尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

TPAMI 2026 | 基于检测Transformer的高效半监督目标检测研究

TPAMI 2026 | 基于检测Transformer的高效半监督目标检测研究 文章目录论文信息论文主要贡献问题论文创新点方法整体框架数据输入师生模型结构阶段式混合匹配(SHM)重解码查询一致性(RQC)损失函数实验分析消融实验结论论文信息论文题目Toward Efficient Semi-Supervised Object DetectionWith Detection Transformer论文作者Jiacheng Zhang , Jiaming Li , Xiangru Lin , Wei Zhang, Xiao Tan, Hongbo Gao(Member IEEE) , Jingdong Wang(Fellow IEEE) , Guanbin Li(Member IEEE)发表会议TPAMI 2026代码链接: https://github.com/JCZ404/Semi-DETR论文主要贡献提出了Semi-DETR这是一个专为基于DETR的架构设计的半监督目标检测新框架。这是首个探索并明确在半监督目标检测任务中应用DETR所面临核心挑战的系统性研究。提出了一种阶段性混合匹配策略该策略能从抗噪声的一对多分配动态过渡到标准的一对一分配。这该方法有效缓解了DETR框架中由噪声伪标签导致的训练低效问题同时保留了其端到端推理的特性。提出了一种重解码查询一致性RQC这是一种专为基于查询的解码器设计的简单但有效的正则化方法。这一创新通过利用模型自身的解码输出来实现高效的一致性训练无需进行复杂的查询选择和对应匹配。大量实验表明在MS-COCO和PASCAL VOC基准测试的各种半监督目标检测设置中Semi-DETR达到了新的最先进水平显著优于以往的方法。问题DETR固有的一对一分配机制对噪声伪标签高度敏感当面对不完美的伪标签时它往往会错误地将高质量的候选检测结果当作负样本从而误导学习过程。基于查询的解码器架构使有效一致性正则化方案的设计变得复杂基于注意力驱动的、动态的基于查询的解码器特性使得在不同增强输入之间无法建立稳定的查询对应关系。因此伪标签和一致性训练这两种有效的半监督学习技术在应用于DETR架构时其效果会受到严重削弱。左图分配策略的敏感性分析。固有的一对一O2O分配对真实框中的噪声更敏感。相比之下传统的一对多O2M分配对噪声标签表现出更强的抵抗性。右图与传统的基于CNN的检测器相比基于DETR的半监督目标检测SSOD中一致性训练问题的说明。论文创新点提出了Semi-DETR这是一个用于基于DETR的高效端到端半监督目标检测的新型框架引入了一种阶段性混合匹配SHM策略。提出了一种简单但有效的重解码查询一致性RQC方案以实现对基于查询的解码器的有效一致性正则化。方法整体框架Semi-DETR 框架基于经典的Mean-Teacher师生架构同时融合了论文提出的两大创新组件阶段式混合匹配SHM和重解码查询一致性RQC。数据输入标注数据黄色路径带有标注框的图像冲浪图的红框用于计算监督损失L s \mathcal{L}_{s}Ls​。未标注数据蓝色路径无标注的图像长颈鹿图通过数据增强生成两个视图用于生成伪标签和一致性训练。师生模型结构Encoder编码器提取图像特征输出编码特征。Decoder解码器对编码特征进行解码生成目标检测预测。Re-Decoding重解码将解码器的预测结果和特征再次输入解码器。教师模型权重通过EMA从学生模型更新生成稳定的伪标签。输出Dense Prediction密集预测经过NMS非极大值抑制和置信度阈值 (δ \deltaδ)筛选后生成高质量Pseudo-labels伪标签用于监督学生模型。学生模型直接参与训练接收三类损失信号更新参数。阶段式混合匹配(SHM)该方法将训练过程分为两个不同的阶段。在早期阶段采用软一对多分配方式以挽救可能被标签噪声抑制的高质量候选框同时降低不可靠候选框的权重。随着训练的推进当伪标签变得更加可靠时我们在后期阶段无缝过渡到标准的一对一匹配。这种设计逐步消除重复预测从而在保留DETR端到端推理特性的同时显著提高了在存在噪声情况下的训练鲁棒性和效率。早期软一对多匹配训练初期伪标签噪声高SHM为每个伪标签框分配多个正候选框且通过分类分数IoU的综合指标计算匹配质量为候选框赋予不同权重——高质量候选框权重高充分参与训练低质量候选框权重低其负面影响被削弱。解决了“高质量候选被误判为负样本”的优化冲突让模型在噪声环境下也能稳定收敛。后期一对一匹配随着训练推进教师模型生成的伪标签精度持续提升噪声几乎消失此时SHM会切换回DETR原始的一对一匹配。这一阶段的核心作用是让模型逐步学习“一个查询对应一个目标”的映射关系自然消除重复预测最终在推理阶段完全保留DETR无NMS、端到端的核心优势实现“训练鲁棒性”和“推理效率”的双赢。论文通过对比Max-IoU、ATSS等传统一对多匹配策略验证了SHM的优越性传统匹配策略为锚框设计适配DETR的稀疏查询时易出现目标覆盖不足、候选框质量不均的问题而SHM的软一对多匹配结合分类和定位指标能为每个伪标签分配数量足够、质量可控的正候选框对伪标签噪声的鲁棒性远优于传统方法。重解码查询一致性(RQC)随着目标查询在解码器层中传播它们会逐渐聚合越来越具有判别性的特征并表现出强烈的局部解码行为与特定的图像区域绑定。基于这一见解RQC方案将来自最终解码器层的密集预测和相应的解码特征再次输入到教师解码器和学生解码器中。这些经过优化的特征充当了一种隐式指导促使查询从相同的显著区域聚合上下文信息。然后在这种“重解码”过程的输出之间应用一致性损失以促进对解码局部性的学习。这巧妙地规避了对显式查询对应匹配的需求为基于查询的架构提供了一种自然且有效的正则化机制。DETR的查询会随解码逐层“绑定固定区域”论文通过**解码不稳定性分数DIS**量化验证了一个关键特性即越靠后的解码器层每个查询会越稳定地绑定图像中的一个特定目标区域。重解码实现“隐式指导”RQC利用上述特性将教师和学生模型最终解码器层的密集预测和解码特征再次输入各自的解码器进行 “重解码”。重解码的过程相当于让查询“基于已锁定的区域再次聚合更精细的上下文特征”这些特征会成为一种隐式指导让师生模型聚焦于同一个目标的显著区域无需手动指定。左解码局部性的量化验证纵轴Decoding Instability Score (DIS解码不稳定性分数)分数越低代表查询越稳定、越绑定固定目标区域横轴Dec. #1-2到Dec. #5-6对应DETR解码器的层间过渡从第1层到第6层共5次层间变化柱形图Early/Middle/Late Stage训练早/中/晚阶段。越深层查询越稳定从#1-2到#5-6所有阶段的DIS分数持续下降证明DETR的查询在解码器层间传播时会逐步聚合更具判别性的目标特征越靠后的层查询的局部解码行为越强越稳定绑定特定目标区域。训练越晚查询越稳定同一层间过渡下Late Stage的DIS分数最低Early Stage最高证明模型训练越充分查询的稳定性越强。深层查询的稳定性强到#5-6层间过渡时所有阶段的DIS分数都接近0说明深层查询几乎完全绑定了固定区域为RQC的设计提供了量化依据。右两种一致性训练方案的对比CQC输入教师和学生模型的dense prediction密集预测经过候选框筛选和ROI-align空间对齐生成对齐的稀疏候选框DETR的查询是动态的不同增强视图下查询和目标的对应关系会发生交叉/错位图中灰色交叉箭头因为查询对应关系不稳定无法建立稳定的一一对应无法做一致性训练需要ROIAlign、候选框筛选等繁琐操作计算成本高还会丢失监督信号。RQC1.先做第一次常规解码得到密集预测再将第一次解码的特征作为隐式指导输入解码器做重解码2. 重解码后的查询已经绑定了第一次锁定的目标区域不同增强视图下同一个查询对应同一个目标不用手动匹配查询3. 不需要候选框筛选、ROIAlign等操作不丢失监督信号计算成本降低损失函数其中L u n s u p c o n s \mathcal{L}_{unsup}^{cons}Lunsupcons​是利用未标记数据计算的一致性损失。L l a b e l \mathcal{L}_{label}Llabel​是包含标记数据和未标记数据的标签监督损失实验分析与最先进方法的比较MS-COCO基准测试 如表所示SemiDETR在MS-COCO基准测试的所有数据机制上都建立了新的最先进水平。Pascal VOC基准测试如表格所述Semi-DETR在PASCAL VOC基准测试中展现出稳定的性能。Semi-DETR在两个评估指标上都以显著的优势超越了所有先前的半监督目标检测方法进一步验证了其鲁棒性。将Semi-DETR扩展到分割任务Semi-DETR的多功能性进一步体现在其在半监督分割任务上的优异表现如上两表所示凸显了半监督学习框架的可迁移性。定性比较展示了Semi-DETR在COCO-partial数据集上不同标记数据比例下的半监督目标检测可视化对比Semi-DETR(b)、(d)与基线方法(a)、©的视觉对比。可以观察到在外观相似和高遮挡等具有挑战性的情况下Semi-DETR的表现更优这体现了其优越性。展示了Semi-DETR在半监督实例分割中的性能在10%标记数据量的半监督实例分割任务中Semi-DETR与引导式蒸馏方法的可视化对比其中Semi-DETR生成了更完整、更精确的分割掩码。消融实验SHM与RQC结合使用时会产生协同效应训练时间评估曲线。aSemi-DETR/Semi-DETR采用阶段性混合匹配消除了早期阶段由噪声伪标签导致的低效训练与简单的半监督基线相比显著提高了训练效率。b新引入的重解码查询一致性进一步提升了收敛速度且性能优于Semi-DETR。超参数消融研究。APL CONF.——用于过滤伪标签的置信度阈值。BFG CONF.——用于过滤预测以构建一致性查询的前景置信度阈值。CNUM POS.——在SHM的一对多分配过程中分配的正样本数量。DUNSUP. LOSS WEIGHT——未标记数据的损失权重。EO2M ITERS.——SHM训练过程中一对多分配的持续时间。一致性查询来源及一致性损失形式的消融实验。“RANDOM”——随机查询“CV”——跨视图查询“RD”——重新解码查询。解码器层上应用一致性的消融实验。一致性训练的性能在不同解码器层之间存在差异应用于后期阶段时性能始终较高。骨干网络消融实验表明该框架的有效性与骨干网络无关凸显了其强大的泛化能力。结论本文研究了将检测TransformerDETRs应用于半监督目标检测SSOD时可能存在的问题。发现基于DETR的半监督目标检测的主要挑战在于易受噪声影响的二分匹配以及基于查询的解码范式不兼容所带来的一致性训练问题。为解决这些问题本文提出了Semi-DETR这是首个基于检测Transformer的端到端半监督目标检测方法。为提高训练效率Semi-DETR设计了一种分阶段混合匹配策略将精心设计的一对多分配策略与固有的二分匹配以分阶段的方式相结合从而在抵抗噪声伪标签的同时保留DETRs宝贵的端到端推理特性。基于查询特征在逐层解码过程中会形成进化局部性这一见解本文引入了重解码查询一致性训练方案以解决基于查询的解码中缺乏确定性对应关系的问题并实现对DETRs的高效一致性正则化。在COCO和PASCAL VOC基准数据集上的大量实验表明Semi-DETR大幅优于现有的半监督目标检测方法。此外通过将该框架扩展到半监督分割任务包括实例分割和语义分割展示了其通用性凸显了其泛化能力。
返回列表