光学仪器  2026, Vol. 48 Issue (1): 30-42   PDF    
SCVi-Net:一种基于混合模型的视网膜血管分割方法
茅纪慧, 姜尚格日乐, 江旻珊     
上海理工大学 光电信息与计算机工程学院,上海 200093
摘要: 现有视网膜血管分割方法通常受限于局部感受野,难以有效捕获全局信息。此外,血管结构在不同尺度下的形态差异较大,使得多尺度特征融合变得困难。为了解决上述问题,提出了一种高效的视网膜血管分割模型SCVi-Net。该模型在U-Net的基础上改进了跳跃连接,引入一个新的空间通道联合注意力模块,通过自适应调整空间和通道权重,增强了特征提取能力。通过在编码器最深层加入视觉Transformer模块,SCVi-Net的全局信息捕获能力得到了提升。空洞空间金字塔池化模块能有效提取多尺度特征,可增强网络的鲁棒性。侧边多尺度融合模块通过融合多个侧边输出,优化了训练过程,从而提升了血管区域的分割精度。为评估模型的优越性,在DRIVE、CHASEDB1和STARE 数据集上进行了对比实验,结果表明,SCVi-Net在复杂视网膜血管图像中具有较好的分割精度和鲁棒性。
关键词: 视网膜血管分割    U-Net    联合注意力机制    Transformer    空洞卷积    SCVi-Net    医学图像处理    
SCVi-Net:a mixed model for retinal vascular segmentation
MAO Jihui, JIANGSHANG Gerile, JIANG Minshan     
College of Optical-Electrical and Computer Engineering, University of Shanghai for Science and Technology, Shanghai 200093, China
Abstract: The existing retinal vascular segmentation methods are often limited to the local receptive field. It is difficult to effectively capture the global information, and the performance of vascular structures at different scales varies greatly, which makes it difficult to process features at different scales at the same time. In order to address the problems, an efficient retinal vascular segmentation model SCVi-Net is proposed. Based on U-Net, the model improves the hop connection, introduces a new SCA module, and enhances the feature extraction ability by adaptively adjusting the space and channel weights. By adding a ViT module to the deepest layer of the encoder, SCVi-Net improves the ability to capture global information. The ASPP module effectively extracts multi-scale features and enhances the robustness of the network. The SSF module optimizes the training process by fusing multiple side outputs and improves the segmentation accuracy of the vascular region. In order to evaluate the superiority of the model, comparative experiments are conducted on DRIVE, CHASEDB1 and STARE datasets. The results show that SCVi-Net has high segmentation accuracy and robustness in complex retinal vascular images.
Key words: retinal vascular segmentation    U-Net    joint attention mechanism    transformer    atrous spatial pyramid pooling    SCVi-Net    medical image processing    

视网膜血管结构分析在眼科疾病的筛查和诊断中具有重要意义,尤其对糖尿病视网膜病变和脉络膜新生血管等血管性眼病的评估至关重要[1-3]。眼底血管的形态特征是医生进行分析判断的重要依据,但视网膜血管的分割面临诸多挑战,主要包括血管细小、脆弱、结构复杂,且血管区域和背景的对比度较低,这些因素显著增加了分割难度。传统的手动分割方法复杂、效率低,同时易受操作者经验和主观因素的影响,因此利用计算机自动分割血管尤为重要。随着深度学习在血管分割领域的不断发展,越来越多的研究开始采用深度学习方法进行眼底图像的血管分割。通过训练深度学习模型,网络能够学习到更复杂的特征,从而减少了对手动特征设计的依赖,进而提升了模型的泛化能力和分割效率。

近年来,随着全卷积神经网络(fully convolutional networks,FCN)[4]的提出,许多全卷积网络语义分割方法也应运而生。Ronneberger等[5]提出的U-Net已被广泛用作高精度模型的骨干网络,该模型主要是将高级语义信息与低级信息相结合。Yu等[6]提出了空洞卷积,它在不丢失分辨率的情况下增大感受野,使卷积神经网络能够处理更大的输入尺寸,并获得更好的特征表示。Luo等[7]在解码部分将U-Net与高级特征融合,同时在编码和解码部分使用跳跃连接,并使用条件随机场来整合全局信息。Gu等[8]在提出的CE-Net 中引入上下文编码器,使用多尺度信息融合策略来捕获高级语义信息,实现了复杂场景中图像的准确分割。Oktay等[9]引入了注意力机制,通过抑制图像中不相关因素来提高血管分割的准确性。Wang等[10]提出了DEU-Net,通过融合将空间信息与上下文信息相结合。Yin等[11]提出了一个深度指导网络,该网络通过集成高级上下文信息和低级详细信息特征,有效提高了分段性能。该网络独特的结构能够捕捉图像中的复杂变化,同时保持边缘清晰度。Chen等[12]提出了 TransUNet,它结合了 Transformer 强大的编码能力和 U-Net 的解码器结构。借助Transformer 的自注意力机制,该结构可捕获全局上下文信息,并跳转连接保留高分辨率的局部细节。Li等[13]提出了一个轻量级的U-Net和一个注意力模块,以重点关注视网膜血管的微小结构。Dong等[14]提出了基于U-Net结构的CRAUNet模型,通过引入DropBlock正则化减少过拟合,并采用多尺度融合通道注意力模块来优化跳跃连接。Liu等[15]提出了ResDO-UNet,该模型通过残差深度可分离卷积增强特征提取,同时采用池化融合和注意力融合减少信息损失并优化跳跃连接。Kar等[16]提出了一种基于生成对抗网络的视网膜血管分割方法,该模型中生成器采用多尺度残差卷积神经网络进行分割,判别器使用视觉变换器进行二分类,最终获得了高精度的分割结果,并在噪声环境中表现稳定。Liu等[17]提出轻量级视网膜血管分割网络 Wave-Net,通过细节增强和去噪块提升细小血管分割精度,并采用多尺度特征融合块优化局部特征。Ding等[18]提出了RCAR-UNet,该模型结合深度神经网络和粗糙集理论处理不确定性,通过引入粗糙通道注意力模块和残差连接,增强了特征提取能力,在精确分割脆弱血管方面具有较高的准确性。Li等[19]提出了一种新的视网膜血管分割方法DPL-GFT-EFA。该方法通过图像去噪任务预训练模型来提高抗干扰能力,使用门控融合变换器模块融合高层次特征,并引入边缘频率注意力模块来加强血管边缘细节和通道特征。Ma等[20]通过结合U-Net架构和监督注意力机制提升视网膜血管分割精度;引入解码器融合模块增强特征提取;采用上下文压缩和激励模块减少细小血管特征丢失;并提出监督融合模块有效融合多尺度特征,改进低级和高级特征的结合。Dosovitskiy等[21]提出的视觉Transformer模块,先将图像划分为16×16的图像块并将其作为输入,随后借助Transformer模型进行特征学习,其性能超越了传统卷积神经网络。Cao等[22]将纯Trans- former架构与U-Net结合,提出了一种基于Swin-Transformer[23]的U-Net变体,其在医学图像分割任务中性能表现优秀。越来越多的研究将Transformer架构应用于医学图像分割任务。大部分Transformer模型是通过补丁嵌入来缓解输入图像尺寸的问题,但这种操作可能会导致空间细节的丢失。同时,血管的细微变化对于医学信息的提取是非常重要的,但传统卷积神经网络在处理血管图像分割这种复杂任务时可能会忽略空间和通道维度的重要性。

基于上述问题,本文提出了一种混合型的网络模型SCVi-Net,主要用于视网膜的血管分割。该网络主要有4个核心部分:空间通道联合注意力(spatial-channel attention,SCA)模块、视觉Transformer (vision Transformer,ViT)模块、空洞空间金字塔池化(atrous spatial pyramid pooling,ASPP)模块和侧边多尺度融合(side-scale fusion,SSF)模块。同时用深度可分离卷积代替原来的卷积块,以降低网络的参数量,减少计算成本。

1 方 法

提出了一种高效的视网膜血管分割模型SCVi-Net,完整的网络架构如图1所示。该模型的主干网络基于U-Net架构,包含5个编码层和4个对称的解码层。为提高血管分割精度,本文对传统的U-Net跳跃连接方式进行了改进,在编码器部分的末端加入了一个新的注意力模块−SCA模块,用于增强神经网络中的特征表示,使血管分割结果更加准确。首先,编码器部分通常负责提取图像的高层语义信息,而解码器是恢复或生成特定信息,因此在编码器最深层引入ViT编码器模块。该模块主要包含多头自注意力和前馈神经网络等,主要对图像块进行特征提取和处理,在低层特征与高层特征之间建立联系,进行有效的全局建模,提升特征表达的能力。为了进一步丰富特征信息,采用了ASPP模块。通过使用不同尺度的空洞卷积来提取ViT模块处理后的多尺度信息,从而减少信息丢失。最后,使用SSF模块为网络训练提供更多的监督。此外,在各模块中利用深度可分离卷积代替普通卷积过程,有效降低计算量。

图 1 SCVi-Net网络结构图 Figure 1 Architecture of the SCVi-Net
1.1 空间通道联合注意力机制

在视网膜血管图像中,血管的形态和位置可能会受到噪声、对比度和光照变化等多种因素的影响,传统的卷积操作无法很好地捕捉到这些变化的关键特征。为了应对这些挑战,在编码器的跳跃连接阶段设计了一个新的注意力机制SCA,使得网络能够自适应地调整关注重点,增强血管区域的特征表示,从而提高模型在复杂图像中的表现,提升分割精度。图2所示为该模块的结构图,其中AAP、DSConv、GAP和FC分别表示自适应平均池化、深度可分离卷积、全局平均池化和全连接层。

图 2 注意力模块原理图 Figure 2 Schematic diagram of the attention module

将特征图$ x\in\mathrm{\mathbf{R}}^{N\times C\times H\times W} $输入到注意力模块的两个分支,分别在高度方向和宽度方向进行池化,使网络识别全局的空间信息,理解每个空间位置的重要性。在高度方向池化后的输出可以表示为

$ {x}_{\mathrm{h}}\left[i,j,1,k\right]=\frac{1}{H}\sum _{l=1}^{H}x\left[i,j,l,k\right] $ (1)

同样的,在宽度方向上进行池化后的输出可以表示为

$ {x}_{\mathrm{w}}\left[i,j,l,1\right]=\frac{1}{W}\sum _{k=1}^{W}x\left[i,j,l,k\right] $ (2)

式中:$ H $$ W $分别为输入特征图在高度和宽度维度上的大小;$ i、j、l、k $分别表示批量、通道、高度、宽度的值。

将上述池化后的特征图沿通道维度拼接起来,然后用$ 1\times 1 $深度可分离卷积$ {f}^{1\times 1} $进行变换,经卷积后再进行批归一化操作,并利用激活函数。接着对通道进行全局平均池化来压缩通道信息,并通过两个全连接层计算每个通道的注意力权重。最后,将通道注意力权重与输入进行加权。随后在高度维度和宽度维度上进行分割,同样利用深度可分离卷积进行处理,再一次经过全局平均池化和全连接层计算每个通道的注意力系数,进一步调整通道的权重。将输入图像与高度方向的注意力权重$ {\alpha }_{\mathrm{h}} $和宽度方向的注意力权重$ {\mathrm{\alpha }}_{\mathrm{w}} $相乘,最终输出

$ {F}_{\mathrm{o}\mathrm{u}\mathrm{t}}=x\cdot {\alpha }_{{\mathrm{h}}}\cdot {\alpha }_{{\mathrm{w}}} $ (3)

SCA模块同时关注特征图的通道关系和空间位置关系,可在通道维度和空间维度上灵活地调整权重,有效提高网络的特征提取能力。在空间位置方面,SCA模块聚焦图像的关键位置信息,能够更好地捕捉空间上下文信息;在通道维度方面,该模块能够关注到最有意义的特征通道,减少不相关和冗余信息,提高模型的准确性和鲁棒性。

1.2 视觉 Transformer

传统的卷积神经网络通常通过卷积层来实现特征提取,在ViT中输入的图像被划分为一系列小块,并通过 Transformer 架构进行处理。为了有效提取图像的全局信息,进一步增强图像特征的提取能力,在编码器最深层引入了ViT模块。该模块结合了Transformer架构强大的表达能力,采用了多头注意力机制(multi-head atten- tion)、多层感知机(multilayer perceptron,MLP)、位置编码(positional encoding)、残差连接和归一化策略,进一步提升了模型的性能。该模块的结构图如图3所示。

图 3 ViT模块结构图 Figure 3 Structure of the ViT module

首先,输入特征图,将位置编码加入到输入特征中,为每个输入的图像块添加一个位置索引,从而确保模型能够识别图像中不同区域的位置关系。接着,输入数据通过LayerNorm层进行归一化,确保不同层的特征具有一致的尺度,以提升模型的学习效率。对经处理后的特征图进行多头自注意力计算,并通过线性层进行映射,从而生成加权的输出,使模型能够同时关注不同区域的不同特征,增强图像表示能力。接着通过残差连接来融合自注意力的输出与输入特征图,使模型直接传递原始的输入信息,从而缓解梯度消失问题,提高训练的稳定性。随后,特征图进入前馈神经网络做进一步处理。通过两个全连接层对特征图进行变换,再利用GELU激活函数和 Dropout 层进一步处理每个图像块的特征,防止过拟合。最后,经过第二次归一化处理和残差连接后的特征图成为ViT模块的最终输出。

1.3 空洞空间金字塔池化

多尺度融合的空洞空间金字塔池化方法主要通过使用不同扩张率的空洞卷积来提取图像的多尺度信息,然后使用全局池化层来获取图像的全局信息。这种方法可以有效提高卷积神经网络对多尺度物体的识别能力和鲁棒性,同时还不需要增加额外的参数,计算量也相对减少。在这个过程中,使用多个并行的卷积核来捕获不同尺度下的特征信息。每个卷积核都具有不同的空洞率,以控制卷积核感受野的大小,其中较大的空洞率对应于更广阔的感受野,可以捕获更多的全局信息,而较小的空洞率对应于更局部的信息。ASPP模块使用的空洞卷积可以在保证分辨率的同时增加感受野,从而避免信息丢失。该模块的结构如图4所示。

图 4 空洞金字塔池化模块结构图 Figure 4 Structure of the ASPP module
1.4 侧边多尺度融合

在SCVi-Net中,引入SSF模块来提供更多的监督信息,以优化网络训练。以往的研究为了直接利用侧向输出预测图,采用简单的平均操作将所有侧向输出图组合起来作为最终预测图[24]。但这种方法对各个侧面输出层进行了相同处理,忽略了不同输出层之间的特征差异。为解决这个问题,本研究利用SSF模块,通过卷积层对多个侧边输出进行有效融合,并结合 Sigmoid 激活函数,有效学习侧边输出层的语义表示。这样能够精确识别血管区域,提升模型在像素级上的分类能力,生成更加精确的血管分割图。

1.5 损失函数

损失函数用于衡量模型预测概率分布与真实标签分布之间的差异,对模型性能至关重要。因此,在视网膜血管分割任务中,损失函数的选择十分重要。由于血管分割是一个二分类任务,本文采用二进制交叉熵损失函数来优化网络参数。该损失函数的表达式为

$ \begin{split} & {F}_{\mathrm{l}\mathrm{o}\mathrm{s}\mathrm{s}}({y}_{i},{p}_{i})=-\frac{1}{N}\\&\qquad {\sum }_{i}^{N}\left[{y}_{i}\cdot \mathrm{log}\left({p}_{i}\right)+(1-{y}_{i})\cdot \mathrm{log}(1-{p}_{i})\right] \end{split}$ (4)

式中:$ N $为构成视网膜图像的像素数;$ {y}_{i} $为第$ i $个类别对应的实际标签(0或1);$ {p}_{i} $为第$ i $个类别对应的预测概率,且$ {p}_{i}\in \left(\mathrm{0,1}\right) $

在处理分类问题时,如果正负样本不平衡,传统的交叉熵损失函数可能会导致模型偏向于数量较多的类别。为解决该问题,采用加权二元交叉熵损失函数,通过为不同类别的样本设置不同的权重来调整损失函数,以平衡各类别的重要性。其表达式为

$ \begin{split} & {F}_{\mathrm{l}\mathrm{o}\mathrm{s}\mathrm{s}}({y}_{i},{p}_{i})=-\frac{1}{N}{\sum }_{i}^{N}\\&\quad\left[{w}_{\mathrm{p}}\cdot {y}_{i}\cdot \mathrm{log}\left({p}_{i}\right)+{w}_{\mathrm{n}}\cdot (1-{y}_{i})\cdot \mathrm{log}(1-{p}_{i})\right] \end{split}$ (5)

式中,$ {w}_{\mathrm{p}} $$ {w}_{\mathrm{n}} $分别为正类和负类的权重,这些权重主要根据正负样本的实际比例来确定。

2 实验设置 2.1 眼底图像数据库

使用DRIVE[25]、STARE[26]和 CHASEDB1[27]数据集对模型进行训练和测试。这3个数据集的关键数据记录见表1,每个数据集的样本如图5所示。

表 1 3个数据集信息概览 Table 1 Overview of the three datasets

图 5 3个数据集中的原始图像、标签和掩膜 Figure 5 Original images, labels, and masks from the three datasets

DRIVE数据集共有40张眼底图像,图像的像素分辨率为565×584。其中50%的图像用于训练,另外50%的图像用于测试。每张图像都包含两位专家手动分割的真值图以及相应的掩膜。

STARE数据集包含了20张眼底图像,每张图像的像素分辨率为605×700。由于STARE没有预定义的训练集和测试集,本文采用十折交叉验证法。

CHASEDB1数据集总共由28张眼底图像组成,这些图像是从14名学龄儿童的样本中获得的。每张图像的视场角为30°,分辨率为999×960。数据集分为训练集和测试集,其中20张图像用于训练,8张用于测试。

2.2 预处理

由于眼底图像数据集样本较少,在训练前对图像采用了多种数据增强方法:(1)角度为[−20°,20°]的随机旋转;(2)概率为0.5的随机水平翻转;(3)伽马值为[0.5,2]的伽马校正。这些数据增强技术有效缓解了网络的过拟合,并提高了其鲁棒性。图6所示为上述数据增强方法处理后的图像。

图 6 数据增强方法 Figure 6 Overview of data augmentation methods
2.3 评价指标

本文采用准确率(accuracy,ACC)Vacc、敏感性(sensitive,SE)Vsen、特异性(specificity,SP)Vspe、交并比(intersection over union,IoU)RIoU、分组样本几何平均数(geometric mean,GM)Mgeo、精度(precision,PRE)Vpre、Dice系数(Dice coefficient)CDice和ROC曲线下的面积AUC等常用的评价指标对模型的性能进行评估。各指标的定义为

$ {V}_{\mathrm{a}\mathrm{c}\mathrm{c}}=\frac{{T}_{\mathrm{N}}+{T}_{\mathrm{P}}}{{T}_{\mathrm{N}}+{T}_{\mathrm{P}}+{F}_{\mathrm{N}}+{F}_{\mathrm{P}}} $ (6)
$ {V}_{\mathrm{s}\mathrm{e}\mathrm{n}}=\frac{{T}_{\mathrm{P}}}{{T}_{\mathrm{P}}+{F}_{\mathrm{N}}} $ (7)
$ {V}_{\mathrm{s}\mathrm{p}\mathrm{e}}=\frac{{T}_{\mathrm{N}}}{{T}_{\mathrm{N}}+{F}_{\mathrm{P}}} $ (8)
$ {C}_{\mathrm{D}\mathrm{i}\mathrm{c}\mathrm{e}}=\frac{2\times {T}_{\mathrm{P}}}{{F}_{\mathrm{P}}+{F}_{\mathrm{N}}+2\times {T}_{\mathrm{P}}} $ (9)
$ {M}_{\mathrm{g}\mathrm{e}\mathrm{o}}=\sqrt{{V}_{\mathrm{s}\mathrm{e}\mathrm{n}}\times {V}_{\mathrm{s}\mathrm{p}\mathrm{e}}} $ (10)
$ {R}_{\mathrm{I}\mathrm{o}\mathrm{U}}=\frac{{T}_{\mathrm{P}}}{{F}_{\mathrm{P}}+{F}_{\mathrm{N}}+{T}_{\mathrm{P}}} $ (11)
$ {V}_{\mathrm{p}\mathrm{r}\mathrm{e}}=\frac{{T}_{\mathrm{P}}}{{F}_{\mathrm{P}}+{T}_{\mathrm{P}}} $ (12)

式中:TP为真阳性,是模型预测正确的正类样本;FP为假阳性,是模型预测错误的正类样本;TN为真阴性,是模型预测正确的负类样本;FN为假阴性,是模型预测错误的负类样本。

2.4 训练细节

本研究模型使用pytorch框架进行训练和验证,所有计算均使用24 GB RTX 3090 GPU 完成。在解码阶段使用自适应矩阵估计算法(adaptive moment estimation,Adam)[28],同时采用二进制交叉熵损失函数。网络学习率设置为0.001,迭代次数(epoch)为150次,批数量(batch size)为2。为确保实验的准确性,所有的训练、验证和测试都在同一台计算机上完成。

3 实验结果与分析 3.1 统计评估

为评估SCVi-Net的性能,在DRIVE、STARE和CHASEDB1数据集中进行各模型的对比实验,所采用的评估指标为:ACC、AUC、SE、SP、IoU、GM、PRE和DICE。基于相同的硬件设备和图像分辨率,将U-Net[5]、AttU-Net[9]、CE-Net[8]、SU-Net[12]、TransUNet[12]、M-Net[19]和FR-UNet[29]与本文提出的SCVi-Net进行比较。各数据集中的对比结果详见表2表3表4,表中每一列的最优值用黑体标注。

表 2 不同方法在DRIVE数据集上分割指标比较 Table 2 Segmentation results on DRIVE

表 3 不同方法在STARE数据集上分割指标比较 Table 3 Segmentation results on STARE

表 4 不同方法在CHASEDB1数据集上分割指标比较 Table 4 Segmentation results on CHASEDB1

在DRIVE数据集上,SCVi-Net有6个评价指标均优于其他方法。与U-Net模型相比,SCVi-Net在ACC、SE、AUC、IoU、GM和DICE上分别提升了0.09%、1.17%、0.10%、0.92%、0.70%和0.69%。在STARE数据集的比较中,SCVi-Net在ACC、SE、IoU、GM和DICE这5个评估指标中性能表现最佳。虽然TransUNet在AUC指标上高于SCVi-Net(0.99460.9941),但增幅仅为0.05%,该优势在实际应用中可以忽略不计。在CHASEDB1数据集上,SCVi-Net在ACC、SP、AUC、IoU、PRE和DICE这6个评估指标上均展现出显著的性能提升。以上对比结果显示,本文提出的SCVi-Net在分割性能方面具有显著的优越性。

3.2 可视化比较

图7所示为SCVi-Net及其他7种模型在DRIVE、STARE和CHASEDB1数据集上的血管分割效果。可视化结果表明,SCVi-Net在血管分割方面表现出色。U-Net在解码器的逐步上采样过程中,原始的高分辨率信息会被模糊化,导致精细的局部信息丢失,分割不够精确。AttU-Net引入了注意力机制,在一定程度上提升了模型对重要区域的关注能力,但由于注意力机制的空间感受野范围和特征依赖范围有限,在一些血管交叉处,模型对微小血管的识别不够。M-Net采用了多尺度策略,对细小血管缺乏足够的感知力,导致小血管的分割效果不理想。CE-Net虽然引用了注意力机制和多尺度特征融合,但从分割效果来看,其特征提取不足,输出的细节不够,血管分割不连续。SU-Net引入了新的结构,但在捕获全局上下文信息方面仍然存在一定的不足,造成部分长血管细节的丢失。TransUNet在捕获全局信息方面的能力有所提升,但由于模型的复杂度和计算成本增加,过拟合的风险仍然存在。FR-UNet采用多级特征融合来提升分割性能,但这也引入了冗余特征。相比之下,SCVi-Net能够更有效地提取特征图信息并定位细小血管分支,血管分割的连续性与准确率显著提升。

图 7 3个数据集上不同模型的可视化血管分割结果 Figure 7 Visualization of vessel segmentation results from various methods across the three datasets
3.3 消融研究

为了验证SCVi-Net中各个模块的有效性,在DRIVE数据集上进行了消融实验。首先,将一个结合深度可分离卷积的U型网络作为消融实验的Baseline,依次引入SCA、ASPP、ViT和SSF 模块,从而组合出8个不同的模型。表5所示为这些不同组合的评估结果。图8所示为这些不同组合在DRIVE数据集上消融实验的可视化比较。

表 5 在DRIVE数据集上的消融实验 Table 5 Ablation studies on DRIVE

(a) 原始视网膜图像,(b) 局部放大图像,(c) 真值图,(d) Baseline+SCA,(e) Baseline+SCA,(f) Baseline+SCA+ASPP,(g) Baseline+SCA+ASPP+ViT,(h) SCVi-Net 图 8 不同组合在 DRIVE 数据集上消融实验的可视化图像 Figure 8 Visual outcomes of various methods in our ablation analysis on the DRIVE dataset

将SCA模块集成到Baseline(Baseline+SCA),并在DRIVE数据集上验证效果。如表5所示,加入SCA模块后,模型的5个评价指标均有所提升,表明SCA模块在血管分割任务中是有效的。在Baseline中引入ASPP模块( Baseline+ASPP),其SE、IoU、GM和DICE均得到提高。同时将SCA和ASPP模块嵌入到Baseline(Baseline+SCA+ASPP),结果表明,和Baseline相比,模型的8个评估指标中只有AUC略有降低(0.01%),由此证明SCVi-Net中SCA和ASPP模块的组合是有效的。引入ViT(Baseline+ViT)后,ACC、SP、IoU、PRE和DICE均得到了提升。同时将SCA、ASPP和ViT模块嵌入到Baseline(Baseline+SCA+ASPP+ViT),大部分评估指标都得到一定程度的改善,因此在SCVi-Net中SCA、ASPP和ViT模块的组合是有效的。为了改善血管分割效果,引入了SSF(Baseline+SSF),ACC、SE、AUC、IoU、GM和DICE均得到了进一步的提升。此外,与Baseline+SCA+ASPP+ViT相比,引入SSF之后,有6个评估指标结果得到了提高。这些实验结果表明,SCVi-Net能够有效应对视网膜血管的形态多样性和语义复杂性。

3.4 与其他主流方法的比较

为进一步证明SCVi-Net的性能,选择了15种主流方法,在DRIVE、STARE和 CHASEDB1数据集上与其进行比较。所选择的方法有:Yan[30]、BTS-DSN[31]、IterNet[32]、Tchinda[33]、EEA-Unet[34]、CSU-Net[35]、CRAUNet[14]、WA-Net[36]、Bridge-Net[37]、Wave-Net[17]、Liang[38]、MCDAU-Net[39]、WS-DMF[40]、SDU-Net[41]和ARSA-UNet[42]表6给出了3个数据集上各方法的性能比较。

表 6 DRIVE、STARE和CHASEDB1上SCVi-Net与其他方法的性能对比 Table 6 Performance comparison of SCVi-Net with other methods on DRIVE, STARE, and CHASEDB1

在DRIVE数据集中,与其他15种方法相比,SCVi-Net获得了最高的ACC、AUC和SP值。WS-DMF结合了卷积神经网络的特征学习能力和匹配滤波的精准模式识别能力,因此在SE值上具有优势,但其ACC和SP值都低于SCVi-Net。对于STARE数据集,SCVi-Net在3个评估指标上实现了最佳。虽然ARSA-UNet在SE方面略高于SCVi-Net(1.49%),但其ACC和SP值相对表现较差。在CHASEDB1数据集上,SCVi-Net同样展现了最佳的ACC和SP值。这进一步验证了该模型在血管分割任务上的优越性。

4 结 语

本文设计了一款用于眼底血管分割的混合模型:在跳跃连接阶段加入了一个新的注意力机制,该注意力机制用于调整空间和通道的权重,突出图像的重要特征;同时,在编码器最底层引入ViT和空洞空间金字塔池化模块,捕获多尺度的特征信息;最终,利用侧边多尺度融合增强对血管边缘和细节的识别。在DRIVE、STARE和CHASEDB1数据集中的性能测试结果表明,本文所提出的方法获得了良好的分割性能。在未来的工作中,将针对不同器官的血管进行分割,进一步对算法进行相应的调优。

参考文献
[1] SEOUD L, HURTUT T, CHELBI J, et al. Red lesion detection using dynamic shape features for diabetic retinopathy screening[J]. IEEE Transactions on Medical Imaging, 2016, 35(4): 1116–1126. DOI:10.1109/TMI.2015.2509785
[2] 王韩影, 蒋炎, 王晴仪, 等. 光学相干断层扫描血管成像技术观察糖尿病性视网膜病变及糖尿病性黄斑水肿患者视网膜血流变化[J]. 上海交通大学学报( 医学版), 2021, 41(2): 166–172. DOI:10.3969/j.issn.1674-8115.2021.02.007
[3] OLIVEIRA C M, CRISTÓVÃO L M, RIBEIRO M L, et al. Improved automated screening of diabetic retinopathy[J]. Ophthalmologica, 2011, 226(4): 191–197. DOI:10.1159/000330285
[4] LONG J, SHELHAMER E, DARRELL T. Fully convolutional networks for semantic segmentation[C]//Proceedings of 2015 IEEE Conference on Computer Vision and Pattern Recognition. Boston, USA: IEEE, 2015: 3431 − 3440.
[5] RONNEBERGER O, FISCHER P, BROX T. U-net: Convolutional networks for biomedical image segmentation[C]//Proceedings of the 18th International Conference on Medical Image Computing and Computer-Assisted Intervention – MICCAI 2015. Munich: Springer, 2015: 234 − 241.
[6] YU F , KOLTUN V. Multi-Scale Context Aggregation by Dilated Convolutions[C]// arXiv preprint. ICLR. 2016. DOI:10.48550/arXiv.1511.07122.
[7] LUO L, CHEN D L, XUE D Y. Retinal blood vessels semantic segmentation method based on modified U-net[C]//2018 Chinese Control And Decision Conference (CCDC). Shenyang: IEEE, 2018: 1892 − 1895.
[8] GU Z W, CHENG J, FU H Z, et al. CE-Net: Context encoder network for 2D medical image segmentation[J]. IEEE Transactions on Medical Imaging, 2019, 38(10): 2281–2292. DOI:10.1109/TMI.2019.2903562
[9] OKTAY O , SCHLEMPER J , FOLGOC L L , et al. Attention U-Net: Learning Where to Look for the Pancreas[J]. arXiv preprint. 2018. DOI:10.48550/arXiv.1804.03999.
[10] WANG B, QIU S, HE H G. Dual encoding U-Net for retinal vessel segmentation[C]//22nd International Conference. Shenzhen, China: Springer-Verlag, 2019: 84 − 92.
[11] YIN P S, YUAN R, CHENG Y M, et al. Deep guidance network for biomedical image segmentation[J]. IEEE Access, 2020, 8: 116106–116116. DOI:10.1109/ACCESS.2020.3002835
[12] CHEN J N, LU Y Y, YU Q H, et al. TransUNet: Transformers make strong encoders for medical image segmentation[J]. arXiv preprint. 2021. DOI:10.48550/arXiv.2102.04306.
[13] LI X, JIANG Y C, LI M L, et al. Lightweight attention convolutional neural network for retinal vessel image segmentation[J]. IEEE Transactions on Industrial Informatics, 2021, 17(3): 1958–1967. DOI:10.1109/TII.2020.2993842
[14] DONG F F, WU D Y, GUO C Y, et al. CRAUNet: A cascaded residual attention U-Net for retinal vessel segmentation[J]. Computers in Biology and Medicine, 2022, 147: 105651. DOI:10.1016/j.compbiomed.2022.105651
[15] LIU Y H, SHEN J, YANG L, et al. ResDO-UNet: A deep residual network for accurate retinal vessel segmentation from fundus images[J]. Biomedical Signal Processing and Control, 2023, 79: 104087. DOI:10.1016/j.bspc.2022.104087
[16] KAR M K, NEOG D R, NATH M K. Retinal vessel segmentation using multi-scale residual convolutional neural network (MSR-Net) combined with generative adversarial networks[J]. Circuits, Systems, and Signal Processing, 2023, 42(2): 1206–1235. DOI:10.1007/s00034-022-02190-5
[17] LIU Y H, SHEN J, YANG L, et al. Wave-Net: A lightweight deep network for retinal vessel segmentation from fundus images[J]. Computers in Biology and Medicine, 2023, 152: 106341. DOI:10.1016/j.compbiomed.2022.106341
[18] DING W P, SUN Y, HUANG J S, et al. RCAR-UNet: Retinal vessel segmentation network algorithm via novel rough attention mechanism[J]. Information Sciences, 2024, 657: 120007. DOI:10.1016/j.ins.2023.120007
[19] LI Y, XU L F, JIN Y Z, et al. Diffusion probabilistic learning with gate-fusion transformer and edge-frequency attention for retinal vessel segmentation[J]. IEEE Transactions on Instrumentation and Measurement, 2024, 73: 2523513.
[20] MA Z D, LI X B. An improved supervised and attention mechanism-based U-Net algorithm for retinal vessel segmentation[J]. Computers in Biology and Medicine, 2024, 168: 107770. DOI:10.1016/j.compbiomed.2023.107770
[21] DOSOVITSKIY A, BEYER L, KOLESNIKOV A, et al. An image is worth 16×16 words: Transformers for image recognition at scale[J]. arXiv preprint. 2020. DOI:10.48550/arXiv.2010.11929.
[22] CAO H, WANG Y Y, CHEN J, et al. Swin-Unet: Unet-like pure transformer for medical image segmentation[C]//Proceedings of the Computer Vision – ECCV 2022 Workshops. Tel Aviv: Springer, 2022: 205 − 218.
[23] LIU Z, LIN Y T, CAO Y, et al. Swin transformer: Hierarchical vision transformer using shifted windows[C]//Proceedings of 2021 IEEE/CVF International Conference on Computer Vision. Montreal: IEEE, 2021: 9992 − 10002.
[24] FU H Z, CHENG J, XU Y W, et al. Joint optic disc and cup segmentation based on multi-label deep network and polar transformation[J]. IEEE Transactions on Medical Imaging, 2018, 37(7): 1597–1605. DOI:10.1109/TMI.2018.2791488
[25] STAAL J, ABRAMOFF M D, NIEMEIJER M, et al. Ridge-based vessel segmentation in color images of the retina[J]. IEEE Transactions on Medical Imaging, 2004, 23(4): 501–509. DOI:10.1109/TMI.2004.825627
[26] HOOVER A D, KOUZNETSOVA V, GOLDBAUM M. Locating blood vessels in retinal images by piecewise threshold probing of a matched filter response[J]. IEEE Transactions on Medical Imaging, 2000, 19(3): 203–210. DOI:10.1109/42.845178
[27] OWEN C G, RUDNICKA A R, MULLEN R, et al. Measuring retinal vessel tortuosity in 10-year-old children: validation of the computer-assisted image analysis of the retina (CAIAR) program[J]. Investigative Ophthalmology & Visual Science, 2009, 50(5): 2004–2010.
[28] KINGMA D P, BA J. Adam: A method for stochastic optimization[J]. arXiv preprint. 2014. DOI:10.48550/arXiv.1412.6980.
[29] LIU W T, YANG H H, TIAN T, et al. Full-resolution network and dual-threshold iteration for retinal vessel and coronary angiograph segmentation[J]. IEEE Journal of Biomedical and Health Informatics, 2022, 26(9): 4623–4634. DOI:10.1109/JBHI.2022.3188710
[30] YAN Z Q, YANG X, CHENG K T. A three-stage deep learning model for accurate retinal vessel segmentation[J]. IEEE Journal of Biomedical and Health Informatics, 2019, 23(4): 1427–1436. DOI:10.1109/JBHI.2018.2872813
[31] GUO S, WANG K, KANG H, et al. BTS-DSN: Deeply supervised neural network with short connections for retinal vessel segmentation[J]. International Journal of Medical Informatics, 2019, 126: 105–113. DOI:10.1016/j.ijmedinf.2019.03.015
[32] LI L Z, VERMA M, NAKASHIMA Y, et al. IterNet: Retinal image segmentation utilizing structural redundancy in vessel networks[C]//2020 IEEE Winter Conference on Applications of Computer Vision (WACV). Snowmass: IEEE, 2020: 3645 − 3654.
[33] SAHA TCHINDA B, TCHIOTSOP D, NOUBOM M, et al. Retinal blood vessels segmentation using classical edge detection filters and the neural network[J]. Informatics in Medicine Unlocked, 2021, 23: 100521. DOI:10.1016/j.imu.2021.100521
[34] Sathananthavathi V, Indumathi G. Encoder enhanced atrous (EEA) unet architecture for retinal blood vessel segmentation[J]. Cognitive Systems Research, 2021, 67: 84–95. DOI:10.1016/j.cogsys.2021.01.003
[35] WANG B, WANG S P, QIU S, et al. CSU-Net: A context spatial U-Net for accurate blood vessel segmentation in fundus images[J]. IEEE Journal of Biomedical and Health Informatics, 2021, 25(4): 1128–1138. DOI:10.1109/JBHI.2020.3011178
[36] ALVARADO-CARRILLO D E, DALMAU-CEDEÑO O S. Width attention based convolutional neural network for retinal vessel segmentation[J]. Expert Systems with Applications, 2022, 209: 118313. DOI:10.1016/j.eswa.2022.118313
[37] ZHANG Y, HE M, CHEN Z N, et al. Bridge-Net: Context-involved u-net with patch-based loss weight mapping for retinal blood vessel segmentation[J]. Expert Systems with Applications, 2022, 195: 116526. DOI:10.1016/j.eswa.2022.116526
[38] 梁礼明, 冯骏, 彭仁杰, 等. 融合多标签损失与双注意力的U型视网膜血管分割[J]. 计算机辅助设计与图形学学报, 2023, 35(1): 75–86. DOI:10.3724/SP.J.1089.2023.19257
[39] ZHOU W, BAI W Q, JI J H, et al. Dual-path multi-scale context dense aggregation network for retinal vessel segmentation[J]. Computers in Biology and Medicine, 2023, 164: 107269. DOI:10.1016/j.compbiomed.2023.107269
[40] TAN Y B, YANG K F, ZHAO S X, et al. Deep matched filtering for retinal vessel segmentation[J]. Knowledge-Based Systems, 2024, 283: 111185. DOI:10.1016/j.knosys.2023.111185
[41] 刘伯成, 何利文. 基于SDU-Net网络的视网膜血管分割[J]. 软件工程与应用, 2024, 13(4): 556–566. DOI:10.12677/sea.2024.134058
[42] XIE Y, SHANG J K, YANG Q, et al. ARSA-UNet: Atrous residual network based on structure-adaptive model for retinal vessel segmentation[J]. Biomedical Signal Processing and Control, 2024, 96: 106595. DOI:10.1016/j.bspc.2024.106595