107、YOLOv8改进实战:Transformer Decoder检测头替换——DETR风格端到端检测实现从一次线上事故说起去年有个项目,客户要求在密集场景下检测200+类目标,YOLOv8的anchor-based检测头在重叠目标上频繁漏检。调试到凌晨三点,盯着tensorboard里那些乱成一锅粥的预测框,突然意识到——NMS后处理把大量正确框给滤掉了。当时就想,要是能像DETR那样端到端输出,省掉NMS这个麻烦精该多好。这个想法在脑子里盘旋了三个月,直到最近才真正动手把Transformer Decoder塞进YOLOv8的检测头。今天把这套方案拆开揉碎了讲,代码都跑过验证,踩过的坑也一并标注。为什么非要动检测头YOLOv8的检测头本质上是anchor-free的卷积预测器,每个grid cell预测四个回归值和类别概率。问题在于它天然依赖NMS做后处理——当两个目标中心点落在同一个grid cell附近时,模型会输出多个高度重叠的框,NMS一刀切下去,正确框和错误框一起被干掉。Transformer Decoder的set-based预测逻辑完全不同。它通过可学习的object queries与图像特征做交叉注意力,每个query独立预测一个目标,输出天然就是去重的。训练时用匈牙利匹配算法做二分图匹配,推理时直接输出最终结果,NMS?不需要了。架构怎么改核心思路:把YOLOv8的检测头替换成Transformer De