
文章目录1.论文信息2.论文主要贡献3.论文创新点4.研究方法4.1 DUALVISION的设计4.2 数据集4.2.1 用于IR-RGB标注的智能体框架4.2.2 用于指令微调的 DV-204K4.2.3 用于评估的 DV-5005.实验验证5.1 消融实验5.1.1 模态消融实验5.1.2 融合策略消融实验5.2 对比试验6.个人声明1.论文信息论文题目DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning论文作者Abrar Majeedi, Zhiyuan Ruan, Ziyi Zhao, Hongcheng Wang, Jianglin Lu, Yin Li发表单位威斯康星大学麦迪逊分校亚马逊东北大学发表会议CVPR 2026代码链接https://abrarmajeedi.github.io/dualvision2.论文主要贡献提出DualVision融合模块一种轻量级的RGB-IR融合模块采用多尺度局部交叉注意力机制。每个RGB补丁令牌仅关注其空间邻域内的IR令牌保证空间对齐同时显著降低计算开销。表1.计算成本和参数数量DUALVISION引入了可忽略不计的新参数和计算成本同时保持了有竞争力的性能。构建两个新数据集DV-204K约25K个对齐的IR-RGB图像对包含约204K个模态感知的问答对用于指令微调。每个QA对标注了依赖的模态RGB或IRDV-500500个IR-RGB图像对每个图像对配有一个需要跨模态推理的二元问答对用于评估。RGB图像被施加三种退化模糊、黑暗、雾每种四个严重级别共13种评估条件。提出智能体标注框架自动为IR图像生成高质量描述。该框架通过LLM迭代生成候选描述并由IR-CLIP模型提供对比反馈最终由更强LLM综合选出最优描述。解决了IR图像缺乏大规模语言标注的问题避免了依赖RGB描述合成IR描述带来的偏差。提出退化感知训练策略在训练过程中以一定概率对RGB图像施加随机退化强制模型在RGB不可靠时更多依赖IR特征从而提升鲁棒性。3.论文创新点模块设计提出了轻量级融合模块DUALVISION数据扩充引入了两个数据集benchmark进行基准测试并在视觉退化条件下实现了优异性能4.研究方法4.1 DUALVISION的设计图2. DUALVISION的概述。(a)展示了DUALVISION如何集成到MLLM中以融合RGB和红外图像令牌实现稳健的视觉推理。(b)说明了多尺度局部交叉注意力模块其中RGB令牌作为查询红外令牌作为键和值。©可视化了在执行局部交叉注意力时的空间对齐的RGB–红外令牌网格。模型架构使用预训练的CLIP ViT-L/14作为共享的视觉编码器分别提取RGB和IR的补丁令牌。DualVision模块通过多尺度局部交叉注意力半径r1,2,3逐步融合两种模态的信息。融合后的令牌通过线性投影输入LLMLLaVA 1.5-7BLLM部分仅通过LoRA进行微调。训练在DV-204K上训练2个周期使用8×A100 GPU约1小时完成。评估在DV-500上使用精确匹配准确率比较模型在不同退化类型和严重程度下的表现。4.2 数据集4.2.1 用于IR-RGB标注的智能体框架图 3. RGB、IR 描述和 QA 对。我们展示了配对的 RGB-IR 图像示例以及它们特定于模态的描述和从这些描述中生成的相应问答对。RGB 描述包含更丰富的场景细节如光照、服装和背景而 IR 描述则反映高层次信息如人物存在和整体场景类型。智能体框架标注流程候选生成 LLM (Claude Sonnet 3.5 v2) 基于输入线索或标签生成一组多样的候选描述对比细化 特定模态的对比模型 (IR LanguageBind) 评估候选文本与 IR 图像的对齐程度并分配相似度分数。这些分数引导 LLM 在闭环过程中进行多轮9 轮迭代细化逐步提高准确性和相关性最终选择 最后细化的候选描述及其对比分数由更强大的 LLM (Claude Opus) 综合成一个最能捕捉 IR 输入图像语义的最终描述表2.红外图像标题的质量通过使用大语言模型作为评判者的方法进行评估将红外图像标题与配对图像的可见光图像标题进行对比。大多数红外图像标题在准确性方面评分良好或更高但描述性细节较低这与红外图像中视觉线索较少的情况一致。4.2.2 用于指令微调的 DV-204KHDRT -9.5K 个对齐的 IR-RGB 图像对保留 500 对用于测试LLVIP -15K 个对来源互补HDRT 捕捉了多样化的环境设置而 LLVIP 侧重于弱光城市场景DV-204K约 25K 个对齐的 IR-RGB 对约 204K 个 QA 标注平均每张图像有 8.1 个 QA 对问题在RGB 和 IR 依赖的线索之间平均分配确保学习的模型暴露于特定模态的推理和跨模态对齐图 4. DV-500 中的 RGB 退化条件。三种失真类型的示例黑暗、模糊和雾每种应用于四个严重级别IR 保持不变。这些受控退化能够系统评估 VLMs 的鲁棒性。4.2.3 用于评估的 DV-500500 个对齐的 IR-RGB 图像对和 500 个 QA问题设计来自两种模态的互补信息来自 IR 的语义结构和来自 RGB 的细粒度外观线索-评估 IR 图像是否可以在 RGB 图像退化时进行补偿利用任何剩余的颜色或纹理信息开放式问题转换为二进制的“是/否”陈述准确率是指标图像从 HDRT 中采样并应用退化同时保留 IR 信号对 RGB 图像应用失真实现三种失真类型黑暗、模糊和雾每种有四个严重级别加上一个干净条件总共 13 个评估类别图 45.实验验证5.1 消融实验5.1.1 模态消融实验图5.不同模态的性能IR、RGB、RGBIR。仅红外IR的性能在退化程度增加时保持稳定仅RGB的性能随着退化严重程度的增加而急剧下降而RGBIR则提供了最稳健的结果仅 RGB预训练的 LLaVA 1.5 7B 权重无需额外微调仅 IR 为公平起见仅在 DV-204K 上使用 IR 图像进行微调结论单模态模型在干净和退化设置下的表现都明显较差仅 IR 模型在 DV-500 上的准确率最低由于没有 RGB 输入性能在退化过程中保持平稳仅 RGB 模型在干净输入上表现良好但随着失真越加严重效果变差整合两种模态在所有退化类型上都产生了一致的改进多模态融合对于鲁棒感知很重要5.1.2 融合策略消融实验图6.融合方法的比较。我们比较了多种融合策略加法、自适应加法、拼接和DUALVISION。拼接基线等同于微调的LLaVA-1.5-7B5.2 对比试验表3.DV-500上的主要结果。我们在干净和退化条件下将我们的方法与强大的开源和商业MLLM基线进行比较图7.在DV-500上的结果。两种方法在基于DV-204K进行微调后都能正确回答并使用干净的RGB–IR输入左侧。当RGB图像退化时右侧我们可以看到DUALVISION保持了鲁棒性而微调后的LLaVA-1.5则表现出可靠性下降6.个人声明本文为作者对原论文的学习笔记与心得分享受个人学识与理解所限文中对论文内容的解读或有不够周全之处一切以原论文正式表述为准。本文仅用于学术交流与传播内容均由作者独立整理完成不代表本公众号立场。如文中所涉文字、图片等内容存在版权争议请及时与作者联系作者将在第一时间核实并妥善处理。