Deep learning-based auxiliary diagnosis for Parkinson's disease using magnetic resonance images
引 言 帕金森病(Parkinson's disease,PD)又称震颤麻痹,迄今为止仅可延缓其病程,尚无治愈方法。PD的诊断既可根据疾病直接的临床特征,如步态[1]、腕部姿态[2]、面部表情[3]、足底触觉[4]等,也可根据间接的差异性表现,如语音信号[5]、手绘图[6-8]、可穿戴传感器的信号[9-11]等,但外部特征受环境影响大,诊断具有主观性。
根据国际帕金森和运动障碍学会(international Parkinson and movement disorder society)有关帕金森和帕金森前驱体临床诊断标准,伴有黑质致密带(substantia nigra pars compacta,SNpc)神经变性和突出蛋白沉积的临床特征是PD诊断的金标准。SNpc是多巴胺能神经元缺失的主要区域[12],利用其神经影像学变化诊断帕金森病的特异性和敏感性均为100%[13]。磁共振成像(magnetic resonance imaging,MRI)中多巴胺能功能正常黑质核团–1轴位呈现燕尾状特征,称为“燕尾征”[14]。如图1所示,PD进程中的铁沉积导致SNpc背外侧高信号缺失,图像上表现为燕尾征消失。用燕尾征消失来区分PD与健康对照的总体敏感性和特异性分别达到97.7%和94.6%[15],准确率为90%[16]。结合黑质区域及燕尾征的特异性变化进行PD的诊断更为客观和准确。
研究人员希望通过分割黑质区域,以SNpc信号强度作为疾病诊断标准。Le Berre等[17]使用医学图像分割的卷积神经网络U-Network对帕金森病二维MRI图像进行分割,但因SNpc区域分割困难,并未得到信号与病程间的显著相关性。部分研究采取分割中脑区域,通过容积测定[18]或超声重建[19]获取中脑体积信息,计算中脑与脑桥容积比[20]等方法分析疾病进展,但诊断结果受分割精度影响较大,且量化分析通常需要大量的时间,因而存在一定的局限性。
另外一些研究人员利用深度学习强大的拟合能力,使用MRI图像训练网络模型来诊断疾病。张巧丽等[16]使用优化后的Alexnet模型对帕金森病组、正常对照组、多系统萎缩症组进行分类实验,获得了88%的分类准确度,但无相关证据表明该模型是根据SNpc区域作出的诊断。Shinde等[21]提出了一种基于神经黑色素敏感图像的卷积神经网络,用于诊断PD、非典型帕金森综合征和正常对照组,实验通过类激活图证明了黑质区域对诊断结果有较大贡献,但因输入图像是手动提取的,且在二分类任务中准确率仅达到80%,故在临床推广应用中存在困难。
现阶段的研究还存在一些不足:1)通过分割黑质区域来量化区分PD与健康对照组,其整体分割难度较大,诊断容错率和准确度不高;2)利用全脑MRI图像结合深度学习技术直接进行训练和分类,但缺乏证据表明该模型是根据黑质区域的特异性改变而做出的判断,缺乏规避无用特征输入网络对判断结果造成影响的措施,使得全脑图像诊断结果不可靠。考虑到以上研究中存在的问题,提出了一套基于深度学习的帕金森病辅助诊断框架,使用图像分割模型处理二维全脑图像,得到中脑区域图像,再使用图像分类模型对分割完毕的样本图像进行疾病诊断,多次迭代后获得良好的疾病诊断结果。
1 深度学习模型构建 本文提出的基于深度学习的帕金森病辅助诊断框架如图2所示。先从公开数据库帕金森病进展标志物计划(Parkinson's progression markers initiative,PPMI)与阿尔茨海默病神经影像学计划(Alzheimer's disease neuroimaging initiative,ADNI)获得了受试者脑部的三维核磁共振图像,每个样本在轴向选取5张包含中脑结构的二维切片,将部分二维切片手动标注ground truth来训练图像分割模型,使用优化完毕的分割模型批量处理剩余全脑切片。接着使用自适应裁剪算法将图片调整至保留上下文特征信息的最小尺寸,并将其输入至改进后的MobilenetV2模型,训练网络对图像的鉴别能力。
1.1 数据源、预处理及实验环境 本研究数据从PPMI、ADNI数据库获得。从数据库中随机选择了564名受试者信息,包括来自PPMI数据库的266名PD患者信息及48名正常受试者信息,来自ADNI数据库的250名正常受试者信息,详见表1。
表 1
(Table 1)
表 1 受试者临床信息
Table 1 Clinical information of participants
| 相关信息 | 帕金森病 | 正常对照 |
| 数量 | 266 | 48+250 | | 年龄(均值±标准差) | 63.11±9.67 | 67.98±10.76 | | 性别(男/女) | 168/98 | 131/167 |
|
表 1 受试者临床信息
Table 1 Clinical information of participants
|
考虑到目标面积比较小,提出了自适应裁剪策略,有效增加中脑区域的目标面积比。将自适应裁剪与中心裁剪以及直接改变尺寸的方法进行了对比,结果如图3所示。考虑到特征不明显、边缘模糊等问题,使用限制对比度的自适应直方图均衡化解决对比度弱、亮度低、特征不明显的问题。但自适应直方图均衡化处理后引入了一些边缘噪声,因此使用双边滤波去除噪声,最后使用图片锐化功能强化图片边缘,以削弱滤波造成的边缘模糊情况,详见图4。
1.2 中脑区域分割 本研究以视觉几何组(visual geometry group,VGG)卷积神经网络作为特征提取的主干,搭建了U形网络,命名为VGG-UNet。网络结构如图5所示,左侧的压缩部分由卷积和下采样构成,每次下采样之前捕获一次当前网络层提取到的特征图,称为Feature X(1~5),而右侧的解压缩部分由卷积和上采样构成,将输入的特征图上采样扩大尺寸后与相同尺寸的Feature X(1~5)在通道维度进行拼接。该网络使用DiceLoss损失函数(LDice)区分中脑区域和背景,其中Dice系数(CDice)可以简化为
|
$ {C}_{\mathrm{D}\mathrm{i}\mathrm{c}\mathrm{e}}=\frac{2\displaystyle\sum _{i=1}^{N}{y}_{i}{\hat{y}}_{i}+\varepsilon }{\displaystyle\sum _{i=1}^{N}{y}_{i}+\displaystyle\sum _{i=1}^{N}{\hat{y}}_{i}+\varepsilon }=\frac{2\left|{y}_{i}\cap {\hat{y}}_{i}\right|+\varepsilon }{\left|{y}_{i}\right|+\left|{\hat{y}}_{i}\right|+\varepsilon } $
|
(1) |
|
$ {L}_{\mathrm{D}\mathrm{i}\mathrm{c}\mathrm{e}}=1-{C}_{\mathrm{D}\mathrm{i}\mathrm{c}\mathrm{e}} $
|
(2) |
式中:N为分割输出的总像素;$ {y}_{i} $和$ {\hat{y}}_{i} $分别为像素$ i $的预测分割结果和真实标签;$ \varepsilon $为较小值,防止分母为零。当预测结果与真实标签相差较大时,$ {C}_{{\mathrm{Dice}}} $较小,网络权值更新的多。当预测结果与真实标签相差较小时,$ {C}_{{\mathrm{Dice}}} $较大,给网络权值带来的更新越少。
分割任务中,随机挑选了两类数据的各10%,手动标注生成对应的ground truth,以7∶3的比例分为训练集和验证集,训练分割神经网络。另取10%的数据作为外部测试集,模型Batch size设置为64,学习率设置为10−5,选择Adam优化器,训练共迭代100个epoch。
本文使用的分割网络在每次提取到特征后,接续SE模块对当前特征矩阵进行重新的权重分配。设特征矩阵$ \boldsymbol{F} $的尺寸为$ {\mathbb{R}}^{H\times W\times C} $,其中H,W与C分别表示矩阵的高、宽与通道数。
|
$ {\boldsymbol{F}}\in {\mathbb{R}}^{H\times W\times C} $
|
(3) |
第一步,使用平均池化将每个通道上的H×W个像素压缩(squeeze)为一个像素,使用该像素值代替原来该通道的全局信息。此时特征矩阵$ \boldsymbol{F} $尺寸从H×W×C变为$ {\boldsymbol{F}}_{\mathrm{s}\mathrm{q}\mathrm{u}} $的1×1×C。
|
$ {\boldsymbol{F}}_{\mathrm{s}\mathrm{q}\mathrm{u}}=\frac{1}{H\times W}\sum _{j=1}^{j=H}\sum _{i=1}^{i=W}\boldsymbol{F},\quad {\boldsymbol{F}}_{\mathrm{s}\mathrm{q}\mathrm{u}}\in {\mathbb{R}}^{1\times 1\times C} $
|
(4) |
第二步,采用两个连续的全连接层处理压缩后的特征矩阵,对应下式的$ {w}_{1} $、$ {w}_{2} $,其中$ \delta $是激活函数ReLU,$ \sigma $是激活函数Sigmoid,在两个全连接层后分别使用ReLU和Sigmoid激活函数对原特征矩阵进行激发(excitation),调整权重分配。此时特征矩阵$ {\boldsymbol{F}}_{\mathrm{s}\mathrm{q}\mathrm{u}} $尺寸从1×1×C变为$ {\boldsymbol{F}}_{\mathrm{e}\mathrm{x}\mathrm{c}} $的C×1×1。
|
$ {\boldsymbol{F}}_{\mathrm{e}\mathrm{x}\mathrm{c}}=\sigma \left[{w}_{2}\delta \left({w}_{1}\times {\boldsymbol{F}}_{\mathrm{s}\mathrm{e}\mathrm{q}}\right)\right],\quad {\boldsymbol{F}}_{\mathrm{e}\mathrm{x}\mathrm{c}}\in {\mathbb{R}}^{C\times 1\times 1} $
|
(5) |
第三步,将原特征矩阵每个通道上的H×W个像素值乘以对应通道的权重,映射为新的表达,完成特征图的重校准,得到校正后的特征矩阵$ \tilde{\boldsymbol{F}} $。网络可以自适应地调整每个通道的权重,以增强对于任务的关键特征的响应,从而提高图像分割的性能。
|
$ \tilde{\boldsymbol{F}}={\boldsymbol{F}}\times {\boldsymbol{F}}_{\mathrm{e}\mathrm{x}\mathrm{c}} $
|
(6) |
1.3 图像分类网络模型 考虑到实际应用需求,本文选择如图6(a)所示的深度可分离卷积搭建的MobilenetV2模型作为主干网络进行改进:融合注意力机制重置特征矩阵权重;融合多尺度特征捕获模块增加多层级特征沟通;引入TanhExp激活函数节约运算资源和训练时间。网络整体框图如图7所示,具体网络参数详见表2。图6(b)所示的多尺度特征捕捉的Inception模块中,设输入特征矩阵为$ {\boldsymbol{I}}_{\mathrm{i}\mathrm{n}} $,尺寸为H×W×C。
表 2
(Table 2)
表 2 分类网络详细参数设置
Table 2 Detailed parameter settings for the classification network
| 输入 |
运算单元 |
t |
c |
n |
s |
u |
| 224²×1 |
Conv2d |
|
32 |
1 |
2 |
否 |
| 112²×32 |
bottleneck |
1 |
16 |
1 |
1 |
否 |
| 112²×16 |
bottleneck |
6 |
24 |
2 |
2 |
否 |
| 56²×24 |
bottleneck |
6 |
32 |
3 |
2 |
否 |
| 28²×32 |
bottleneck |
6 |
64 |
4 |
2 |
否 |
| 14²×64 |
bottleneck |
6 |
96 |
3 |
1 |
否 |
| 14²×96 |
bottleneck |
6 |
160 |
3 |
1 |
否 |
| 14²×160 |
bottleneck |
6 |
320 |
1 |
1 |
否 |
| 14²×320 |
Conv2d 1×1 |
|
1280 |
1 |
1 |
否 |
| 14²×1280 |
Inception |
|
512 |
|
1 |
|
| 14²×512 |
bottleneck |
6 |
512 |
1 |
2 |
是 |
| 7²×512 |
Inception |
|
512 |
|
1 |
|
| 7²×512 |
bottleneck |
6 |
512 |
1 |
1 |
是 |
| 7²×512 |
AvgPool 7×7 |
|
|
1 |
|
|
| 1²×512 |
dropout |
|
|
|
|
|
| 1²×512 |
Conv2d 1×1 |
|
2 |
|
|
|
| 注:dropout. 随机失活层;t. 扩展因子;c. 输出特征矩阵的channel;n. bottleneck的重复次数;s. 第一层bottleneck的步距;u. use attention是否使用注意力机制模块。 |
|
表 2 分类网络详细参数设置
Table 2 Detailed parameter settings for the classification network
|
|
$ {\boldsymbol{I}}_{\mathbf{i}\mathrm{n}}\in {\mathbb{R}}^{H\times W\times C} $
|
(7) |
用式(8)表示对特征矩阵的卷积操作
|
$ {\boldsymbol{Y}}_{\boldsymbol{i}}={\mathrm{Conv}}\left({\boldsymbol{I}}_{\mathbf{i}\mathrm{n}}\text{,}{K}_{i}\right) $
|
(8) |
式中:$ {\boldsymbol{Y}}_{\boldsymbol{i}} $为支路的输出特征矩阵;$ {K}_{i} $为卷积核的具体大小。由此,上述Inception结构的4条支路具体运算过程可表示为
|
$ {\boldsymbol{Y}}_{1}={\mathrm{Conv}}\left({\boldsymbol{I}}_{\mathrm{i}\mathrm{n}}\text{,}{K}_{1\times 1}\right) $
|
(9) |
|
$ \begin{split} &
{\boldsymbol{Y}}_{2} = {\mathrm{Conv}} [\kern-0.15em[ \delta \left\langle{{\mathrm{Conv}}\left\{\delta \left[{\mathrm{Conv}}\left({\boldsymbol{I}}_{\mathrm{i}\mathrm{n}}\text{,} {K}_{1\times 1}\right)\right]\text{,} {K}_{3\times 3}\right\}}\right\rangle\text{,} \\& \qquad {K}_{1\times 1}]\kern-0.15em] \\[-1pt]
\end{split}$
|
(10) |
|
$ \begin{split} &
{\boldsymbol{Y}}_{3}={\mathrm{Conv}} [\kern-0.15em[ \delta \left\langle{{\mathrm{Conv}}\left\{\delta \left[{\mathrm{Conv}}\left({\boldsymbol{I}}_{\mathrm{i}\mathrm{n}}\text{,}{K}_{1\times 1}\right)\right]\text{,}{K}_{5\times 5}\right\}}\right\rangle\text{,} \\& \qquad {K}_{1\times 1} ]\kern-0.15em]\\[-1pt]
\end{split} $
|
(11) |
|
$ {\boldsymbol{Y}}_{4}={\mathrm{MaxPool}}\left({\boldsymbol{I}}_{\mathrm{i}\mathrm{n}}\text{,}{K}_{3\times 3}\right) $
|
(12) |
将所有支路的输出矩阵$ {\boldsymbol{Y}}_{\boldsymbol{i}} $沿着通道维度进行拼接,得到最终的输出特征矩阵Y。
|
$ {\boldsymbol{Y}}={\mathrm{Concat}}\left({\boldsymbol{Y}}_{1},{\boldsymbol{Y}}_{2},{\boldsymbol{Y}}_{3},{\boldsymbol{Y}}_{4}\right) $
|
(13) |
输出特征矩阵Y包含不同层级提取到的特征信息,对于黑质区域需要较大感受野捕获整体强度信息,对于燕尾征微小特征点则需要敏锐的局部感知能力。应用Inception结构既兼顾了不同感受野尺寸的需求,又增加了网络的宽度,提高了网络工作的效率。
同时,在Inception提取多尺度特征之后,在平均池化层之前,于模型中搭建两层如图6(c)所示的坐标注意力机制(coordinate attention,CA)用来调整输入特征矩阵的权重分配。假设输入特征矩阵为$ {\boldsymbol{C}}_{\mathrm{i}\mathrm{n}} $,尺寸为$ H\times W\times C $。
|
$ {\boldsymbol{C}}_{\mathrm{i}\mathrm{n}}\in {\mathbb{R}}^{H\times W\times C} $
|
(14) |
全局平均池化分为对特征矩阵高和宽的维度进行池化,捕获了两个方向上的信息交互。$ {\boldsymbol{Z}}_{\mathrm{A}\mathrm{W}}\left(H\right) $表示沿矩阵宽方向完成平均池化后的特征矩阵,$ {\boldsymbol{Z}}_{\mathrm{A}\mathrm{H}}\left(W\right) $表示沿矩阵高方向完成平均池化后的特征矩阵。
|
$ {\boldsymbol{Z}}_{\mathrm{A}\mathrm{W}}\left(H\right)=\frac{1}{W}\sum _{i=0}^{i=W}{\boldsymbol{C}}_{\mathrm{i}\mathrm{n}},\quad {\boldsymbol{Z}}_{\mathrm{A}\mathrm{W}}\left(H\right)\in {\mathbb{R}}^{C\times H\times 1} $
|
(15) |
|
$ {\boldsymbol{Z}}_{\mathrm{A}\mathrm{H}}\left(W\right)=\frac{1}{H}\sum _{j=0}^{j=H}{\boldsymbol{C}}_{\mathrm{i}\mathrm{n}},\quad {\boldsymbol{Z}}_{\mathrm{A}\mathrm{H}}\left(W\right)\in {\mathbb{R}}^{C\times 1\times W} $
|
(16) |
将$ {\boldsymbol{Z}}_{\mathrm{A}\mathrm{H}}\left(W\right) $变换维度后与$ {\boldsymbol{Z}}_{\mathrm{A}\mathrm{W}}\left(H\right) $在高这个维度上进行拼接,获得特征矩阵$ \boldsymbol{f} $。
|
$ \begin{split} &
{\boldsymbol{f}}=\delta \left\{{\mathrm{Conv}}\left[{\boldsymbol{Z}}_{\mathrm{A}\mathrm{W}}\left(H\right)\text{,}{\boldsymbol{Z}}_{\mathrm{A}\mathrm{H}}\left(W\right)\right]\text{,}{K}_{1\times 1}\right\}\\& \qquad {\boldsymbol{f}}\in {\mathbb{R}}^{\tfrac{c}{r}\times \left(H+W\right)\times 1}
\end{split} $
|
(17) |
式中,r 表示通道压缩/激发步骤中的缩减比例(reduction ratio)。
再沿着空间维度将$ \boldsymbol{f} $分为$ {\boldsymbol{f}}_{1} $与$ {\boldsymbol{f}}_{2} $
|
$ {\boldsymbol{f}}_{1}\in {\mathbb{R}}^{\tfrac{c}{r}\times H\times 1} $
|
(18) |
|
$ {\boldsymbol{f}}_{2}\in {\mathbb{R}}^{\tfrac{c}{r}\times 1\times W} $
|
(19) |
对特征图分别进行1×1卷积升维和激活后,获得对应的特征向量。
|
$ {\boldsymbol{g}}_{1}=\delta \left[{\mathrm{Conv}}\left({\boldsymbol{f}}_{1}\text{,}{K}_{1\times 1}\right)\right] $
|
(20) |
|
$ {\boldsymbol{g}}_{2}=\delta \left[{\mathrm{Conv}}\left({\boldsymbol{f}}_{2}\text{,}{K}_{1\times 1}\right)\right] $
|
(21) |
使用$ {\boldsymbol{g}}_{1} $和$ {\boldsymbol{g}}_{2} $特征向量指导原特征矩阵权重分布,最终的输出为
|
$ {\boldsymbol{Y}}={\boldsymbol{F}}_{\mathrm{i}\mathrm{n}}\times {\boldsymbol{g}}_{1}\times {\boldsymbol{g}}_{2} $
|
(22) |
此外,本研究将第一层和最后一层卷积层中的ReLU激活函数替换成了TanhExp激活函数。在第一层卷积层之后接续TanhExp激活函数能更好地对输入数据进行归一化。最后一层卷积层常用于提取高级特征,对图像进行分类,在此使用TanhExp激活函数可以提供更丰富的非线性特性,提高模型对图片的识别能力和分类性能,结果如图6(d)所示。
|
$ f\left(x\right)=x{\mathrm{tanh}}\left({\mathrm{e}}^{x}\right) $
|
(23) |
式中:tanh(x)表示以e为底,x为自变量的双曲线正切函数。
|
$ \mathrm{tanh}\left(x\right)=\frac{{\mathrm{e}}^{x}-{\mathrm{e}}^{-x}}{{\mathrm{e}}^{x}+{\mathrm{e}}^{-x}} $
|
(24) |
采用冻结训练的方法,在前100个epoch冻结特征提取部分,仅训练网络后几层,保护预训练权重在前期被大幅改变,节省计算资源。在后100个epoch进行解冻训练,自由更新权重参数,进行网络全程的权重微调。将中脑分割完毕的数据集以7∶2∶1的比例划分为训练集、验证集和测试集。模型使用交叉熵损失函数,Batch size设置为64,初始学习率为$ {10}^{-4} $,按余弦退火进行衰减,使用Adam优化器,共迭代200个epoch。
2 结果与分析 2.1 中脑分割的结果 分割任务的精度直接影响了整个系统的性能和能达到的当前最佳性能(state-of-the-art,SOTA)。在本实验中,测试了VGG-UNet在Dice相似系数(Dice similarity cofficient)D、精确率(precison)P、平均交并比(mean intersection over union,MIOU)M、阳性预测值(positive predict value)V 这4个方面的性能。
|
$ D=\frac{2\times {T}_{\mathrm{p}}}{{F}_{\mathrm{n}}+{T}_{\mathrm{p}}+{T}_{\mathrm{p}}+{F}_{\mathrm{p}}} $
|
(25) |
|
$ P=\frac{{T}_{\mathrm{p}}}{{T}_{\mathrm{p}}+{F}_{\mathrm{p}}} $
|
(26) |
|
$ M=\frac{{T}_{\mathrm{p}}}{{F}_{\mathrm{n}}+{T}_{\mathrm{p}}+{F}_{\mathrm{p}}} $
|
(27) |
|
$ V=\frac{{T}_{\mathrm{p}}}{{T}_{\mathrm{p}}+{F}_{\mathrm{p}}} $
|
(28) |
式中:Tp为真阳性,即在ground truth 中预测为中脑的像素点;Fp表示假阳性,即在ground truth 之外预测为中脑的像素点;Fn表示假阴性,即在ground truth 中预测为背景的像素。训练过程的损失(loss)和平均交并比如图8所示,训练与验证损失未出现较大差异,模型未发生过拟合现象。将外部测试集分为5个数据子集(folder),每个数据子集测试10次,结合手动10次的标注结果的评价指标绘制箱线图。如图9所示,模型表现出类似手工分割的优异性能。
为了对比手动分割与模型分割对分类任务的具体影响,分别使用手工和模型处理300张MRI图像,并将分割结果用于MobilenetV2的分类任务中训练100个epoch后进行预实验。结果如图10所示:由于数据较少,分割前后模型表现出较大的性能波动;手动分割与模型分割具有相似的分类效果,即相似的疾病诊断效能;原始图像直接使用分类网络的分类准确率约为0.7,分割后模型的分类准确率大幅提高,证明了样本质量对诊断性能的巨大影响。为探究各改进措施对分割网络性能的影响,设置了分割模型的消融实验。如表3所示:使用UNet+VGG特征提取网络能够使模型具有更好的分割性能;SE模块单独作用效果不明显,在结合VGG做特征提取时,效果明显提升。
表 3
(Table 3)
表 3 分割性能的消融实验
Table 3 Ablation experiments on segmentation performance
| 模块 | Dice相似系数 | 精确率 | 平均交并比 | 阳性预测值 |
| UNet | 0.91±0.01 | 0.90±0.02 | 0.85±0.01 | 0.89±0.02 | | UNet+VGG | 0.95±0.01 | 0.95±0.01 | 0.92±0.02 | 0.95±0.03 | | UNet+SE | 0.92±0.01 | 0.90±0.02 | 0.87±0.03 | 0.90±0.02 | | UNet+VGG+SE | 0.95±0.02 | 0.96±0.03 | 0.94±0.02 | 0.96±0.02 |
|
表 3 分割性能的消融实验
Table 3 Ablation experiments on segmentation performance
|
2.2 模型诊断结果 如图11所示,原始图像直接输入基准网络的分类效果较差,使用图像增强技术增加像素间对比度,滤除噪声后,模型收敛速度加快。使用图像分割扣除无关背景信息后,网络的分类性能有了大幅提升,热力图也更汇聚于中脑区域。应用自适应裁剪算法之后,网络关注的特征更集中于SNpc区域,与帕金森病诊断标准吻合,诊断结果更可靠。
为了探究网络的每个改进点对模型性能的具体优化程度,设置了改进模块的消融实验,结果如表4所示。将数据集优化完毕后,不引入任何模块的诊断结果作为网络优化的基线。训练过程中,各模块改进对网络性能的提升结果如图12(a)所示。在使用TanhExp激活函数,引入CA模块、Inception结构和使用迁移学习的方法之后,网络均有3到8个点的性能提升,证明以上模块在该分类任务中对诊断性能有积极影响。测试集的表现绘制混淆矩阵如图12(b)所示,根据具体分类情况计算各类别的精确率(precision)、召回率(recall)、F1分数(F1-score)及准确率(accuracy),结果如表5所示。
表 4
(Table 4)
表 4 网络改进模块的消融实验
Table 4 Ablation experiments on network improvement modules
| 分类器 |
因素 |
准确率/% |
| 迁移学习 |
Inception模块 |
CA模块 |
TanhExp |
| MobilenetV2 |
– |
– |
– |
– |
82.4 |
| √ |
– |
– |
– |
89.3 |
| √ |
√ |
– |
– |
93.6 |
| √ |
– |
√ |
– |
94.2 |
| √ |
– |
– |
√ |
91.3 |
| √ |
√ |
√ |
√ |
97.5 |
| 注:√. 使用了对应优化模块或方法;–. 未使用。 |
|
表 4 网络改进模块的消融实验
Table 4 Ablation experiments on network improvement modules
|
表 5
(Table 5)
表 5 分类性能的评价指标
Table 5 Evaluation metrics for classification performance
| 评价指标 |
PD组 |
控制对照组 |
均值 |
| 精确率 |
0.9733 |
0.9773 |
0.9753 |
| 召回率 |
0.9798 |
0.9699 |
0.9748 |
| F1分数 |
0.9765 |
0.9735 |
0.9750 |
| 分类准确率 |
|
0.9752 |
|
|
表 5 分类性能的评价指标
Table 5 Evaluation metrics for classification performance
|
从模型竞争力角度出发,将本文模型与经典图像分类模型Alexnet、VGG16、ResNet、DensNet、Mobilenet 进行对比,结果如表6所示。MobilenetV2模型能很好地平衡参数量与准确率。ResNet101仅次于本文模型,分类准确率达到了94.6%的,但改进后的MobilenetV2模型的参数量不到ResNet101的1/10。选择参数量更小的模型不仅能加快网络训练速度,还能满足低内存和低算力设备的移植要求。接着将本文研究方法与同领域的其他研究方法进行了对比,详见表7。Gu等[22]将帕金森病患者MRI中结构和功能变化最显著的脑区定义为感兴趣区域(region of interest,ROI),对其进行特异性特征提取。他们使用支持向量机(support vector machine,SVM)构建分类器,对存在姿势不稳、步态困难的帕金森患者及非疾病亚型的诊断准确率为92.31%。Abós等[23]重建脑网络中的功能连接体,使用SVM训练功能连接体中的特征,在区分PD与非轻度认知障碍患者的任务中,平均准确率达到了82.6%。陈璐等[24]使用栈式深度多项网络提取MRI中的特征子集,使用SVM对每个子集进行分类,再对分类器进行集成学习,最终得到了90.15%、85.48%和93.27%的分类准确率、敏感度和特异性。Shinde等[21]使用卷积神经网络识别神经黑色素磁敏感成像中的生物标志物,以类激活图确定了黑质区域的关键贡献,最终模型区分PD与进行性核上性麻痹的测试精度达到了85.7%。王洋等[25]以VGG经典网络为基准,搭建了MRI VGG-Net,使用帕金森患者与正常对照的MRI训练网络,获得的诊断准确率达85%以上,可以辅助临床医生进行PD的诊断。对比结果表明,本文提出的结合图像分割的帕金森病MRI诊断方法的性能表现极具竞争力。
表 6
(Table 6)
表 6 与其他主流网络性能的对比
Table 6 Performance comparison with other mainstream networks
| 模型 | 准确率/% | 参数量 |
| Alexnet | 84.4 | 61 | | VGG16 | 87.3 | 138 | | ResNet50 | 92.8 | 25 | | ResNet101 | 94.6 | 44 | | DensNet | 94.3 | 7.58 | | MobilenetV2 | 89.3 | 4.2 | | 本文模型 | 97.5 | 9.76 |
|
表 6 与其他主流网络性能的对比
Table 6 Performance comparison with other mainstream networks
|
表 7
(Table 7)
表 7 与同领域其他研究方法的对比
Table 7 Comparison with other research methods in the same field
| 研究方法 |
研究对象 |
技术方法 |
准确率/% |
| 文献[22] |
PIGD亚型/非PIGD |
ROI+SVM |
92.31 |
| 文献[23] |
PD/nonMCI |
Gre+SVM |
82.6 |
| 文献[24] |
PD/NC |
SDPN+SVM |
90.15 |
| 文献[21] |
PD/ASP |
CNN |
85.7 |
| 文献[25] |
PD/NC |
VGG-Net |
85 |
| 本文方法 |
PD/NC |
VGG-UNet+MobilenetV2 |
97.1 |
| 注:PIGD. 姿势不稳和步态困难亚型;MCI. 轻度认知障碍;Gre. 图谱重建;NC. normal control;SDPN. 栈式深度多项网络;CNN. 卷积神经网络。 |
|
表 7 与同领域其他研究方法的对比
Table 7 Comparison with other research methods in the same field
|
3 结 论 本文提出一种基于深度学习的帕金森疾病辅助诊断框架,用于辅助帕金森病的临床MRI诊断。首先构建了适用于中脑分割的深度学习模型VGG-UNet,结合自适应裁剪算法,获得了高目标面积比的中脑分割图像。具体而言,使用上述方法分割图像在外部验证中的平均Dice相似系数达到0.95±0.02,精确率达到0.96±0.03,平均交并比达到0.94±0.02,阳性预测值达到0.96±0.02。接着使用Inception结构、CA注意力机制和TanhExp激活函数优化MobilenetV2网络,将中脑区域图像输入改进的MobilenetV2网络,对PD和正常对照的诊断准确率达到97.5%,灵敏度达到97.53%,召回率达到97.48%。中脑分割不仅直接提升了诊断准确率,还使诊断模型更关注黑质区域,更符合帕金森病理学对黑质致密区域的医学解释。基于PPMI的数据试验结果表明,本文所提方法在帕金森病的MRI诊断中取得了良好的效果,可为帕金森病的辅助诊断提供支持。