尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

138、顶会注意力机制复现(三):FocalModulation焦点调制注意力在YOLOv12中的实现——NeurIPS2022论文复现与Backbone/Neck双位置消融

138、顶会注意力机制复现(三):FocalModulation焦点调制注意力在YOLOv12中的实现——NeurIPS2022论文复现与Backbone/Neck双位置消融 138、顶会注意力机制复现(三):FocalModulation焦点调制注意力在YOLOv12中的实现——NeurIPS2022论文复现与Backbone/Neck双位置消融兄弟们,上周有个粉丝私信我,说他把Focal Modulation塞进YOLOv12的Backbone之后,训练到第37个epoch直接loss飙到NaN,问我是不是代码写错了。我让他把日志发过来一看,好家伙,梯度范数在第三个stage就开始指数级膨胀,这明显是注意力模块的数值稳定性出了问题。今天咱们就借着这个真实案例,把NeurIPS 2022这篇Focal Modulation Networks的复现过程掰开揉碎了讲清楚。先说结论:Focal Modulation这玩意儿跟传统的MHSA(多头自注意力)完全是两路子。MHSA是计算query和key之间的相似度,本质上是二阶交互;而Focal Modulation是拿一个调制器直接对value做逐元素的仿射变换,本质上是特征重标定。这个区别直接决定了它在YOLOv12里的插入位置——你要是把它当成MHSA的平替直接替换掉C2f里的Bottleneck,那大概率会出问题。咱们先回顾一下论文的核心思想。Focal Modulation包含两个分支:一条是context aggregation分支,用四层下采样卷积构建一个金字塔感受野,每层输出一个不同尺度的上下文特征图,然后通过一个门控机制(就是那个sigmoid激活的线性层)把不同尺度的信息融合起来;另一条是gating分支,生成一个逐通道的调制权重。最终输出就是原始特征乘以调制权重,再加上聚合的上下文特征。注意这里
返回列表