1、论文简介这篇论文的题目是“Grounded Language-Image Pre-training”发表在CVPR 2022。这篇论文中的方法也是大名鼎鼎Grounding DINO的基础。2、论文动机论文的核心目的是为了将目标检测Object detection任务和短语定位Phrase Grounding任务相统一。该论文为了将目标检测任务转换为短语定位任务将最后目标分类的head替换为求取boundingbox的视觉特征和文本特征的相似性。这个是该论文的核心想法和贡献。现有CLIP模型可获得图像级的丰富表征也具有很强的开放词汇能力。然而在Object detection我们需要的是目标级的特征。这个也是这篇论文想解决的问题。在CLIP中图像和文本通常先编码后计算相似度这个就是论文中说的Late Fusion。在这篇论文GLIP中作者认为应该在特征编码的时候就交互两者之间的特征也就是论文中的Deep Fusion。3、论文做法上图是GCLIP的主要流程图具体做法大概如下1模型的输入为Image 和 文本Prompt分别采用视觉编码器和文本编码器进行编码。Image被编码为其中N为影像的token个数d为特征的维度。Prompt被编码为M是Prompt中的token的个数d为特征维度。为了让文本和影像特征充分交流在编码的过程中作者采用Deep fusion模块对文本和影像特征进行融合。Deep fusion采用的是交叉注意力这里就不细说。融合的目的是为了让提取的视觉特征感知到文本特征可提高模型的开放词汇能力也让提取的视觉特征本身就和输入的文本相关联。2在传统检测器中当提取到Image的特征后会再经过一个固定维度的分类器矩阵得到最终的类别的概率这样就可以实现闭集的检测。在GCLIP中不再使用W分类而是计算O和P之间的相似性在原文中公式如下显而易见P代替了W的作用得到的表示的是每个区域和每个文本token之间的相似性。在推理的时候如果我换了Prompt则计算得到的S_ground也会发生改变这个开放词汇的能力不就有了么。作者设计的确实妙呀。3在loss中会约束和真值标签矩阵保持一致也就是对齐损失。同时也会再加一个常规的定位损失完成网络的训练。4、总结该论文将目标检测任务转换为Pharse grounding的任务在提取特征的时候对视觉特征和文本特征进行了充分的交互。通过计算视觉特征和文本特征间的相似性实现最终的grounding也就是检测。参考[1] Li L H, Zhang P, Zhang H, et al. Grounded language-image pre-training[C]//Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. 2022: 10965-10975.