光学仪器  2025, Vol. 47 Issue (2): 50-57   PDF    
AllMix用于标签噪声学习的图像分类方法
邱烨敏, 张荣福, 何晨, 杨紫叶, 高顾昱     
上海理工大学 光电信息与计算机工程学院,上海 200093
摘要: 人工收集和标注的数据集不可避免会含有标签噪声,其对图像分类模型的泛化能力存在负面影响。因此,设计针对含有标签噪声数据集的鲁棒性分类算法成为研究热点。自监督学习预训练耗时且在样本选择后仍包含较多噪声样本是现有方法的主要问题。提出了AllMix模型,该模型节省了预训练的时间,在DivideMix模型的基础上,使用AllMatch训练策略替换原有的MixMatch训练策略。AllMatch训练策略使用焦损和广义交叉熵损失来优化含有标签噪声样本的损失计算,同时引入了高置信度样本半监督学习模块和对比学习模块充分学习无标签噪声样本。实验结果表明,AllMix模型比现有的无训练的标签噪声分类算法的性能,在CIFAR10数据集上,针对50%、80%和90%的对称噪声分别高出了0.7%、0.7%和5.0%,针对含有80%和90%对称噪声的CIFAR100数据集分别提高了2.8%和10.1%。
关键词: 标签噪声学习    图像分类    半监督学习    对比学习    
Image classification approach using AllMix for label noise learning
QIU Yemin, ZHANG Rongfu, HE Chen, YANG Ziye, GAO Guyu     
School of Optical-Electrical and Computer Engineering , University of Shanghai for Science and Technology, Shanghai 200093, China
Abstract: Datasets collected and annotated manually are inevitably contaminated with label noise, which negatively affects the generalization ability of image classification models. Therefore, designing robust classification algorithms for datasets with label noise has become a hot research topic. The main issue with existing methods is that self-supervised learning pre-training is time-consuming and still includes a large number of noisy samples after sample selection. This paper introduces the AllMix model, which reduces the time required for pre-training. Based on the DivideMix model, the AllMatch training strategy replaces the original MixMatch training strategy. The AllMatch training strategy uses focal loss and generalized cross-entropy loss to optimize the loss calculation for labeled samples. Additionally, it introduces a high-confidence sample semi-supervised learning module and a contrastive learning module to fully learn from unlabeled samples. Experimental results show that on the CIFAR10 dataset, the existing pre-trained label noise classification algorithms are 0.7%, 0.7%, and 5.0% higher in performance than those without pre-training for 50%, 80%, and 90% symmetric noise ratios, respectively. On the CIFAR100 dataset with 80% and 90% symmetric noise ratios, the model performance is 2.8% and 10.1% higher, respectively.
Key words: label noise learning    image classification    semi-supervised learning    contrastive learning    
引 言

卷积神经网络(convolutional neural network,CNN)等深度学习技术已广泛应用于图像分类领域[1-3]。CNN所取得的显著成功主要得益于大规模数据集的人工准确标注。然而,获取大量高质量的标注数据既昂贵又耗时。在实际应用中,收集到的数据集往往含有标签噪声:一方面,这种噪声可能来自人工标注的过程,因为人工标注通常需要专业知识,而即使是专家的手动标注结果也会受到经验、精力等因素的影响;另一方面,在数据集的收集和制作过程中,部分大规模的数据集是从网站上收集的,它们往往包含不准确的标签,还有部分大规模数据集是通过一些替代且廉价的方法使用标签挖掘出来的[4]。这些替代方法也不可避免地会引入带有标签噪声的样本。

越来越多的研究致力于减轻带有标签噪声的样本训练的负面影响。早期的研究侧重于探索能够抵御标签噪声影响的鲁棒损失函数。文献[5]尝试用估计噪声转移矩阵来应对标签噪声,但发现在实际应用中准确估计该矩阵既困难又不实用。文献[6]旨在开发耐噪声损失函数,研究人员采用平均绝对误差损失进行模型训练,发现与交叉熵损失相比,其具有更好的泛化能力。然而,当面对复杂的数据集时,模型的收敛会变得困难。一种解决带有标签噪声的样本学习挑战的方法是采用交替训练,该方法包括样本选择和半监督学习两个阶段。样本选择阶段的目的是将干净样本从噪声数据集中分离出来并作为有标签样本集进行监督学习。文献[7-8]采用深度神经网络(deep neural networks,DNN)分类器的自生损失和预测值来将干净样本从噪声数据集中分离出来。例如,Co-teaching[7]方法通过设计双网络协作学习框架,使用小损失来识别干净样本以更新另一个网络的参数。Unicon[8]框架使用Jensen-Shannon散度损失统一选择干净集。文献[9]使用分类器提取的特征表示分离干净样本。半监督学习阶段的目的是对样本选择阶段分离出来的噪声样本进行标签猜测,在产生伪标签后进行训练,从而尽可能脱离原有噪声标签的影响。然而,在样本选择阶段,特别是当标签噪声水平非常高时,DNN分类器总是会过度拟合有噪声的标记样本,从而导致模型自生成的信息,如损失、预测概率或特征表示等始终无法准确识别干净的样本,因此即使在样本选择后,有标签样本集中依旧包含大量噪声样本,最终导致分类器性能的恶化。为了解决交替学习过程中模型对有噪声标记样本的过拟合问题,最近的研究引入了带有对比损失的自监督学习对网络进行预训练,并取得了较好的效果[8]

上述最新研究方法存在两个问题:1)自监督学习的预训练往往会耗费较长的时间;2)在样本选择阶段,筛选出的有标签样本集中仍然存在大量带噪声标签样本, 这会降低模型的训练效果。本文提出了一种新的标签噪声学习鲁棒性算法AllMix。该算法针对分离出的有标签样本集,对低噪声水平的样本集采用焦损(focal loss)[10]使模型聚焦于困难样本,以加快收敛速度并提高分类性能;对高噪声水平的样本集采用广义交叉熵损失(GCE loss)[11]来对抗噪声的影响。与带有预训练的方法不同的是,本文算法在训练过程中加入了高置信度样本半监督学习模块(半监督学习)和对比学习模块(自监督学习)来进一步利用噪声样本优化模型,并且节省了预训练的时间,同时在CIFAR10和CIFAR100数据集上的分类性能也得到了提升。

1 方 法 1.1 AllMix模型结构

DivideMix是一个利用半监督学习技术进行带噪声标签学习的新框架[12],本文设计了AllMix网络模型结构,该模型在DivideMix模型的基础上,使用提出的AllMatch训练策略替换原有的MixMatch训练策略[13]。AllMix模型总框架如图1所示。其中,A和B代表两个模型网络,GMM为高斯混合模型,D表示数据集,XU分别表示模型A或B在特定训练轮次下经过GMM划分后得到的有标签和无标签样本集。X代表有标签的样本集,U代表无标签的样本集。

图 1 AllMix模型总框架图 Figure 1 The framework of AllMix model

AllMix使用高斯混合模型(Gaussian mixture model,GMM)对每一个样本的损失分布进行建模,将训练数据在每一个训练轮次中动态划分为带有干净样本的有标签样本集X和带有噪声样本的无标签样本集U,并以半监督和自监督的方式对有标签和无标签样本集进行模型训练。为了避免确认偏差,AllMix同时训练两个发散网络,其中每个网络使用来自另一个网络通过GMM划分出来的有标签样本集X和无标签样本集U进行训练。在AllMatch训练策略中,保留了DivideMix中对有标签和无标签的样本集执行标签优化(label co-refinement)和标签猜测(label co-guessing)的步骤。此外,AllMatch改进了对有标签样本的损失计算,引入了高置信度样本半监督学习模块和对比学习模块对网络进行训练优化。

1.2 AllMatch训练策略

图2展示了AllMatch的具体训练策略,其中Augw代表弱增强操作,Augs1(∙)和Augs2(∙)代表两种不同的强增强操作,$\widetilde{{y}}_i $代表经过标签优化后的标签,$\widetilde{{v}}_i $代表经过标签猜测后的标签,$\widehat{q} $代表样本在经过Mixup操作后的后一半数据经过模型分类头输出的结果中高于阈值t的伪标签。首先,对于由GMM判定的有标签样本,AllMatch针对不同的噪声情况分别使用了强调学习困难样本的焦损和兼具收敛速度以及抗噪性能的广义交叉熵损失。其次,对于GMM判定的无标签样本,AllMatch引入高置信度样本半监督学习模块,通过筛选出高置信度的样本来生成伪标签,将它们视为有标签数据进行训练。最后,AllMatch引入对比学习模块,通过计算样本在特征表示上的对比损失来进一步增强模型的分类能力。

图 2 AllMatch训练策略 Figure 2 The AllMatch training strategy

在AllMatch训练策略中,设$ X=\{\left({x}_{i},{y}_{i}\right):i\in (1,\cdots ,b\left)\right\} $为一批次的有标签样本,其中$ {x}_{i} $是第i张有标签图像,$ {y}_{i} $是其对应的独特标签,$ U= \{{u}_{i}:i\in (1,\cdots ,b\left)\right\} $为一批次的无标签样本,其中$ {u}_{i} $是第i张无标签图像。对于有标签样本集$ X $,模型会对其进行弱增强$ \mathrm{Aug}_{\mathrm{w}}(\cdot) $得到$ {X}_{{\mathrm{w}}} $。弱增强处理包括随机裁剪、随机水平翻转以及归一化。对于无标签样本集$ U $,模型除了弱增强还进行了强增强$ \mathrm{Aug}_{\mathrm{s}1}(\cdot) $$ \mathrm{Aug}_{\mathrm{s}2}(\cdot) $来得到$ {U}_{{\mathrm{w}}} $$ {U}_{{\mathrm{s}}1} $$ {U}_{{\mathrm{s}}2} $,强增强处理$ \mathrm{Aug}_{\mathrm{s}1}(\cdot) $在弱增强的基础上增加了RandAugment[14]$ \mathrm{Aug}_{\mathrm{s}2}(\cdot) $在弱增强的基础上随机调整图像的亮度、对比度、饱和度和色调。

首先,分别初始化两个相同结构的网络,例如ResNet18。模型在提取特征后设置一个分类头$ {P}_{\mathrm{c}\mathrm{l}\mathrm{s}}(\cdot ) $得到预测概率,一个投影层$ {P}_{\mathrm{p}\mathrm{r}\mathrm{o}\mathrm{j}}(\cdot ) $得到特征向量。

然后,使用弱增强后的样本集$ {X}_{{\mathrm{w}}} $$ {U}_{{\mathrm{w}}} $进行标签优化和标签猜测。在进行网络A的训练时,网络B利用样本的损失值通过GMM得到该样本的干净概率$ {w}_{i} $,网络A将当前样本的真值标签$ {y}_{i} $和通过分类头得到的预测概率$ {p}_{i} $$ {w}_{i} $进行线性组合,从而得到标签优化后的标签$ {\overline{y}}_{i} $

$ {\overline{y}}_{i}={w}_{i}{y}_{i}+\left(1-{w}_{i}\right){p}_{i} $ (1)

接着使用来自两个网络的预测概率来“共同猜测”未标记样本的标签$ {\overline{q}}_{i} $,这可以产生更可靠的猜测标签${\overline{q}}_{i} $

$ {\overline{q}}_{i}=\dfrac{1}{2M}{\displaystyle\sum }_{m}\left({P}_{{\mathrm{cls}}}\right({u}_{i},m;{\theta }^{\left(1\right)})+{P}_{{\mathrm{cls}}}({u}_{i},m;{\theta }^{\left(2\right)}\left)\right) $ (2)

式中:M表示弱增强的次数;m表示第m次增强;$ {u}_{i} $表示未标记数据集;$ {\theta }^{\left(1\right)} $$ {\theta }^{\left(2\right)} $分别表示模型A和模型B的权重。

至此得到了标签优化后的样本集$ X{'}= \{\left({x}_{i},{\overline{y}}_{i}\right):i\in (1,\cdots ,Mb\left)\right\} $和标签猜测后的样本集$ U{'}=\{\left({u}_{i},{\overline{q}}_{i}\right):i\in (1,\cdots ,Mb\left)\right\} $,其中,b代表原始样本集的数量,Mb代表对原始样本集中的每个样本进行M次增强后的样本数量。拼接$ X{'} $$ U{'} $得到样本集$ N=\{\left({n}_{i},{v}_{i}\right):i\in (1,\cdots ,2Mb\left)\right\} $,对N的样本和标签进行Mixup操作[15],具体表达式为

$ \tilde{n}=\lambda {n}_{i}+\left(1-\lambda \right){n}_{i} $ (3)
$ \tilde{v}=\lambda {v}_{i}+\left(1-\lambda \right){v}_{i} $ (4)

式中,$ \lambda \in [0, 1] $,且服从Beta分布。

针对有标签样本,当处理低噪声情况时,对标签优化后的样本计算焦损${L}_{X} $

$ {L}_{X}=-{\displaystyle\sum }_{i=1}^{Mb}{\left(1-{p}_{{\mathrm{cls}}}\left({\tilde{n}}_{i}\right)\right)}^{\gamma }{\mathrm{log}}\left({P}_{{\mathrm{cls}}}\right({\tilde{n}}_{i}\left)\right) $ (5)

式中:$ i\in (1,\cdots ,Mb) $$ \gamma $代表倾向困难样本的程度,$ \gamma $越大,模型对困难样本的关注度越高。

当处理高噪声情况时,计算广义交叉熵损失(GCE loss),如式(6)所示:

$ {L}_{X}=\dfrac{{\displaystyle\sum }_{i=1}^{Mb}\left(1-{{P}_{{\mathrm{cls}}}\left({\tilde{n}}_{i}\right)}^{\alpha }\right)}{\alpha } $ (6)

式中,$ i\in (1,\cdots ,Mb) $。GCE loss融合了平均绝对误差损失(MAE loss)和交叉熵损失(CE loss)。当$ \alpha $=1时,其等价为MAE loss;当$ \alpha $趋向于0时,其等价为CE loss。

针对无标签样本,样本损失$ {L}_{U1} $

$ {L}_{U1}={\displaystyle\sum }_{i=Mb+1}^{2Mb}{||{\tilde{v}}_{i}-{P}_{{\mathrm{cls}}}\left({\tilde{n}}_{i}\right)||}_{2}^{2} $ (7)

式中,$ i\in (Mb+1,\cdots ,2Mb) $

除了通过Mixup计算得到的$ {L}_{X} $$ {L}_{U1} $外,为了充分利用无标签样本集对网络进行训练,AllMatch对无标签样本增加了高置信度样本半监督学习模块和对比学习模块。

在高置信度样本半监督学习模块中,将$ {\tilde{n}}_{i} $[$ i\in (Mb+1,\cdots ,2Mb) $]输入模型后由分类头$ {P}_{{\mathrm{cls}}}(\cdot ) $得到其每一类的预测概率,若最高那一类的置信度大于阈值$ t $,这一类就作为伪标签$ \widehat{q} $,再将强增强后的样本$ {U}_{{\mathrm{s}}1}=\{{s}_{j}:j\in (1,\cdots ,b\left)\right\} $输入模型,得到的预测输出与$ \widehat{q} $计算交叉熵损失$ H(\cdot ) $得到$ {L}_{U2} $,表达式为

$ {L}_{U2}={\displaystyle\sum }_{j=1}^{b}\mathbb{l}({\max}\left({P}_{{\mathrm{cls}}}\left({\tilde{n}}_{i}\right)\right)\ge t)H(\widehat{q},{P}_{{\mathrm{cls}}}({s}_{j}\left)\right) $ (8)

受到文献[16]的启发,AllMatch在已有模块的基础上对无标签样本集U加入了对比学习模块,将$ {U}_{{\mathrm{s}}1} $$ {U}_{{\mathrm{s}}2} $在模型投影层$ {P}_{{\mathrm{proj}}}(\cdot ) $输出的特征进行无监督的对比学习,从而达到进一步优化训练目标的目的。对于大小为b的一个批次的样本,通过两种不同的图像强增强方法得到的$ {U}_{{\mathrm{s}}1} $$ {U}_{{\mathrm{s}}2} $,共得到2b个图像样本,经过投影层$ {P}_{{\mathrm{proj}}}(\cdot ) $后分别得到$ { {\textit{z}}}^{{\mathrm{s}}1} $$ { {\textit{z}}}^{{\mathrm{s}}2} $两个图像的特征向量,具体的对比学习损失函数${L}_{{\mathrm{contrast}}} $

$ \begin{split} {L}_{{\mathrm{contrast}}}=& -{\displaystyle\sum }_{i=1}^{b}{\rm{log}}\dfrac{{\rm{exp}}\left({ {\textit{z}}}_{i}^{{\rm{s}}1}\cdot \dfrac{{ {\textit{z}}}_{i}^{{\rm{s}}2}}{\tau }\right)}{{\displaystyle\sum }_{a\in A\left(i\right)}{\rm{exp}}\left({ {\textit{z}}}_{i}^{{\rm{s}}1}\cdot \dfrac{{ {\textit{z}}}_{a}^{{\rm{s}}1}}{\tau }\right)}=\\ & {\displaystyle\sum }_{i=1}^{b}\Biggr({\rm{log}}{\displaystyle\sum }_{a\in A\left(i\right)}{\rm{exp}}\left({ {\textit{z}}}_{i}^{{\rm{s}}1}\cdot \dfrac{{ {\textit{z}}}_{a}^{{\rm{s}}1}}{\tau }\right)-\Biggr.\\ & \Biggr.{\rm{log}}\Biggr({\rm{exp}}\Biggr({ {\textit{z}}}_{i}^{{\rm{s}}1}\cdot \dfrac{{ {\textit{z}}}_{i}^{{\rm{s}}2}}{\tau }\Biggr)\Biggr)\Biggr) \end{split} $ (9)

式中:$ { {\textit{z}}}_{i}^{{\mathrm{s}}1} $$ { {\textit{z}}}_{i}^{{\mathrm{s}}2} $表示来自第$ i $个样本分别经过$ \mathrm{Aug}_{\mathrm{ }\mathrm{s}1}(\cdot) $$ \mathrm{Aug}_{\mathrm{s}2}(\cdot) $后在投影层的特征表示输出;$ A\left(i\right) $为除了第$ i $个样本以外的其他与$ i $的伪标签$ {\widehat{q}}_{i} $类别不同的样本索引;$ \tau $为温度系数,用来控制困难负样本的惩罚强度。对比学习损失的目的是在特征空间上使得不同类别的图像相互远离,并拉进同一类别的图像。

最终的损失计算公式为

$ \mathrm{\mathit{L}_T}=L_X+\alpha\cdot L_{U1}+L_{U2}+L_{\mathrm{contrast}} $ (10)

式中,$ \alpha $代表学习标签猜测后的样本的损失权重。

2 实验结果和分析

为验证提出的方法在带有标签噪声的数据集的图像分类任务中的有效性,进行了相关实验。首先,介绍了实验使用到的实验平台、数据集和参数设置。然后,评估了提出的方法在噪声数据集上的性能,并与其他类似的方法进行了比较。最后,采用了消融实验,系统地移除模型的某些组成部分。本文旨在探讨各个模块对模型整体性能的贡献,从而深入理解所设计方法的关键因素。

2.1 实验平台

实验使用的服务器GPU型号为英伟达RTX4080,显存为16 GB,Python版本为3.11.7,深度学习框架为PyTorch,版本为2.1.2。

2.2 数据集

实验在CIFAR10数据集和CIFAR100数据集上进行,它们各自由60000张大小为32 × 32的彩色图像组成,其中CIFAR10分为10个类,每个类有6000张图像,CIFAR100分为100个类,每个类有600张图像。由于这两个数据集是无噪声的数据集,根据文献[7]的方法,通过随机替换样本的标签对两个数据集分别生成20%、50%、80%、90%的对称噪声。

2.3 参数设置

在模型训练过程中,为了与其他方法作比较,将常规参数设置与已有方法的保持一致。主干网络选择ResNet18,批量大小设置为128,训练迭代次数为300次,采用随机梯度下降(SGD)来更新参数和优化模型,学习率设置为0.02,冲量设置为0.9,权重衰减为0.0005。弱增强的次数$ M $设置为2,对于CIFAR10数据集,热身的迭代次数设置为10,对于CIFAR100数据集,热身的迭代次数设置为30。在热身轮次中使用交叉熵损失训练,结束热身后,对于20%和50%的数据集,$ {L}_{X} $用于计算焦损;对于80%和90%的数据集,$ {L}_{X} $用于计算广义交叉熵损失。$ \alpha $的设置参考文献[12]、[16]和[17]的最优结果,将温度系数$ \tau $设置为0.07,将$ {L}_{U2} $的阈值$ t $设置为0.95。

2.4 实验结果与分析

为了评估模型的性能,采用了准确率(accuracy)作为模型的评价指标。表1为模型在CIFAR10和CIFAR100数据集上的实验结果,实验中分别测试了其在20%、50%、80%和90%的对称噪声下的性能。表1中给出了不同方法的最佳准确率以及最后10个迭代轮次的平均准确率。其中,CSS虽然整体性能有了较大的领先,但是其使用自监督进行了800个轮次的预训练,这一过程是非常耗时的。同时,CSS需要结合CLIP的辅助信息来消除噪声样本,而CLIP在模型参数量和复杂度上远远超过了ResNet18,对设备的算力要求更高。将本文提出的方法与使用相同网络架构且不使用预训练的其他方法进行比较,结果表明,以上方法在两个数据集低噪声(20%和50%)的情况下效果持平,而在高噪声(80%和90%)的情况下本文方法的性能有较大幅度的提升。对于含有更多类别、挑战难度更高的CIFAR100数据集,在80%和90%的对称噪声下,本文方法的最佳准确率和平均准确率分别提升了2.8%和10.1%。

表 1 AllMix在CIFAR10和CIFAR100数据集添加不同水平对称噪声的实验结果 Table 1 Experimental results of AllMix with different levels of symmetric noise on the CIFAR10 and CIFAR100 datasets

表2所示,为了研究不同模块的有效性,深入探究了提升模型性能的因素,通过删除不同的模块来进行消融实验。

表 2 AllMix在CIFAR10数据集上的消融实验结果 Table 2 Results of the AllMix ablation experiments on CIFAR10 dataset

为了研究高置信度样本半监督学习模块,删除$ {L}_{U2} $并保持其他损失不变来进行模型训练,此时模型的最佳性能在50%、80%和90%的对称噪声下分别下降了2.1%、5%和8.1%。为了研究对比学习模块,删除$ {L}_{{\mathrm{contrast}}} $并保持其他损失不变来进行模型训练,此时模型的最佳性能在20%、50%、80%和90%的对称噪声下分别下降了0.3%、0.6%、3.7%和3.5%。

表1表2的实验结果显示两个数据集在80%和90%对称噪声条件下,采用高置信度样本的半监督学习和对比学习模块对模型性能的提升更为显著。这是由于在高噪声环境下,模型对无标签样本的依赖增加。对此,本文进一步分析两个方面的作用机制和相互影响。

首先,高置信度样本半监督学习模块通过挑选出置信度高的无标签样本,减少了标签噪声对模型学习的干扰,特别是在噪声水平较高时。这些高置信度样本成为了模型学习的关键,因为它们提供了相对准确的信息来引导模型学习。其次,对比学习模块通过强化样本间的区分性,进一步增强了模型对特征的辨识能力。在高噪声条件下,传统的学习机制容易受到噪声的干扰,而对比学习通过优化样本间的相对关系,为模型提供了一种鲁棒的学习路径,使得模型能够在复杂的噪声环境中更好地提取有用信息。

表2可知,在去掉$ {L}_{U2} $后,模型在50%的对称噪声下的训练后期性能起伏明显,这也表明高置信度样本半监督学习模块可以促进模型收敛的稳定性。

结合这两个模块,模型能够在高噪声水平下有效地利用无标签样本,不仅提高了模型对噪声的鲁棒性,也稳定了学习过程和模型的收敛性。这一发现强调了在设计面向标签噪声数据集的模型时,重视无标签样本的处理机制是提高模型性能的关键。

3 结 论

基于深度学习的图像分类性能依赖于数据集的质量,而在很多场景下,数据集中的标签噪声不可避免。本文提出了AllMix网络模型,该网络采用AllMatch训练策略,针对在不同噪声情况下的有标签样本集采用不同的损失计算方式,引入高置信度样本半监督学习模块和对比学习模块来充分利用无标签样本集对模型进行训练。实验结果表明,模型在没有经过预训练的情况下,在不同噪声水平的CIFAR10和CIFAR100数据集上性能得到了提升。在CIFAR10数据集上,针对50%、80%和90%的对称噪声,模型性能比现有的无预训练的标签噪声分类算法分别高出了0.7%,0.7%和5.0%。对含有80%和90%对称噪声的CIFAR100数据集,模型性能分别提高了2.8%和10.1%。本文提出的标签噪声学习鲁棒性算法可以进一步拓展到图像分割、目标检测、自然语言处理等任务上。

参考文献
[1] KRIZHEVSKY A, SUTSKEVER I, HINTON G E. ImageNet classification with deep convolutional neural networks[C]//Proceedings of the 25th International Conference on Neural Information Processing Systems. Lake Tahoe: Curran Associates Inc., 2012.
[2] HE K M, ZHANG X Y, REN S Q, et al. Deep residual learning for image recognition[C]//Proceedings of 2016 IEEE Conference on Computer Vision and Pattern Recognition. Las Vegas: IEEE, 2016: 770 − 778.
[3] 张杰, 夏春蕾, 张荣福, 等. 基于注意力机制的水果损伤检测及分类[J]. 光学仪器, 2023, 45(2): 26–35.
[4] LI W, WANG L M, LI W, et al. WebVision database: visual learning and understanding from web data[J]. arXiv preprint, arXiv: 1708.02862, 2017.
[5] SUKHBAATAR S, BRUNA J, PALURI M, et al. Training convolutional networks with noisy labels[J]. arXiv preprint, arXiv: 1406.2080, 2014.
[6] GHOSH A, KUMAR H, SASTRY P S. Robust loss functions under label noise for deep neural networks[C]//Proceedings of the 31st AAAI Conference on Artificial Intelligence. San Francisco: AAAI, 2017: 1919−1925.
[7] HAN B, YAO Q M, YU X R, et al. Co-teaching: robust training of deep neural networks with extremely noisy labels[C]//Proceedings of the 32nd International Conference on Neural Information Processing Systems. Montréal: Curran Associates Inc., 2018.
[8] KARIM N, RIZVE M N, RAHNAVARD N, et al. UNICON: combating label noise through uniform selection and contrastive learning[C]//Proceedings of 2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New Orleans: IEEE, 2022: 9676 − 9686.
[9] SHARMA K, DONMEZ P, LUO E M, et al. NoiseRank: unsupervised label noise reduction with dependence models[C]//Proceedings of the 16th European Conference on Computer Vision. Glasgow: Springer, 2020: 737 − 753.
[10] LIN T Y, GOYAL P, GIRSHICK R, et al. Focal loss for dense object detection[C]//Proceedings of 2017 IEEE International Conference on Computer Vision. Venice: IEEE, 2017: 2980 − 2988.
[11] ZHANG Z L, SABUNCU M R. Generalized cross entropy loss for training deep neural networks with noisy labels[C]//Proceedings of the 32nd International Conference on Neural Information Processing Systems. Montréal: Curran Associates Inc., 2018.
[12] LI J N, SOCHER R, HOI S C H. DivideMix: learning with noisy labels as semi-supervised learning[C]//Proceedings of the 8th International Conference on Learning Representations. Addis Ababa: OpenReview, 2020.
[13] BERTHELOT D, CARLINI N, GOODFELLOW I, et al. MixMatch: a holistic approach to semi-supervised learning[C]//Proceedings of the 33rd International Conference on Neural Information Processing Systems. Vancouver: Curran Associates Inc., 2019.
[14] CUBUK E D, ZOPH B, SHLENS J, et al. Randaugment: practical automated data augmentation with a reduced search space[C]//Proceedings of 2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition.Seattle: IEEE, 2020: 702 − 703.
[15] ZHANG H Y, CISSÉ M, DAUPHIN Y N, et al. Mixup: beyond empirical risk minimization[C]//Proceedings of the 6th International Conference on Learning Representations. Vancouver: OpenReview, 2018.
[16] YANG F, WU K, ZHANG S Y, et al. Class-aware contrastive semi-supervised learning[C]//Proceedings of 2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New Orleans: IEEE, 2022: 14421 − 14430.
[17] SOHN K, BERTHELOT D, LI C L, et al. FixMatch: simplifying semi-supervised learning with consistency and confidence[C]//Proceedings of the 34th International Conference on Neural Information Processing Systems. Vancouver: Curran Associates Inc., 2020: 596 − 608.
[18] YU X R, HAN B, YAO J C, et al. How does disagreement help generalization against label corruption?[C]//Proceedings of the 36th International Conference on Machine Learning. Long Beach: PMLR, 2019: 7164 − 7173.
[19] YI K, WU J X. Probabilistic end-to-end noise correction for learning with noisy labels[C]//Proceedings of 2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Long Beach: IEEE, 2019: 7017 − 7025.
[20] LI J N, WONG Y, ZHAO Q, et al. Learning to learn from noisy labeled data[C]//Proceedings of 2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Long Beach: IEEE, 2019: 5051 − 5059.
[21] ARAZO E, ORTEGO D, ALBERT P, et al. Unsupervised label noise modeling and loss correction[C]//Proceedings of the 36th International Conference on Machine Learning. Long Beach: PMLR, 2019: 312 − 321.
[22] MIAO Q, WU X H, XU C, et al. Learning with noisy labels using collaborative sample selection and contrastive semi-supervised learning[J]. Knowledge-Based Systems, 2024, 296: 111860. DOI:10.1016/j.knosys.2024.111860