尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

【CVPR 2025】面向医学视觉语言模型的提示学习框架 BiomedCoOp|从医学影像AI提示学习视角

【CVPR 2025】面向医学视觉语言模型的提示学习框架 BiomedCoOp|从医学影像AI提示学习视角 摘要本文解读 CVPR 2025 论文《BiomedCoOp: Learning to Prompt for Biomedical Vision-Language Models》。该论文提出BiomedCoOp一个面向医学影像的提示学习Prompt Learning框架通过融合GPT-4 大语言模型提示集成SCCM与基于中位数绝对偏差统计离群剔除的知识蒸馏KDSP让冻结的 BiomedCLIP 仅学习 4 个上下文 token 即可完成高效少样本医学图像分类其特别之处在于用 LLM 生成的模态感知提示替代手工提示模板并用统计筛选防止过专化。实验表明16-shot 平均准确率达 72.42%超最强基线 1.5ppBase-to-Novel 调和平均 75.07超最强基线 7.6pp零样本准确率从 42.05% 提升至 52.27%为医学影像大模型的参数高效适配提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息为什么医学影像难以直接使用 CLIP 类视觉语言模型研究主线从问题到结论基准/方法设计两大组件如何协同方法分类全景三层次技术栈方法细节四个核心设计要素实验设计与结果11 个数据集上的全面评测评测协议主结果11 数据集平均准确率 %Base-to-Novel 泛化组件消融谁在起作用可解释性与超参数分析结果对比总结关键发现局限性常见问题FAQBiomedCoOp 与 CoOp 有什么区别为什么用 LLM 生成提示而不是手工设计KDSP 的统计筛选是如何工作的BiomedCoOp 需要多少标注数据代码开源了吗参考链接论文基本信息项目内容标题英文BiomedCoOp: Learning to Prompt for Biomedical Vision-Language Models标题中文面向医学视觉语言模型的提示学习框架 BiomedCoOp作者Taha Koleilat, Hojat Asgariandehkordi, Hassan Rivaz, Yiming Xiao机构康考迪亚大学Concordia University· 电气与计算机工程系 / 计算机科学与软件工程系会议CVPR 2025arXivhttps://arxiv.org/abs/2411.15232项目网站https://github.com/HealthX-Lab/BiomedCoOp为什么医学影像难以直接使用 CLIP 类视觉语言模型医学影像与自然图像有本质差异标注稀缺隐私与临床专家成本高、图像对比度不直观MRI、超声等模态外观迥异、判别特征细微颜色、纹理、形态、解剖上下文都与病理变化相关。直接对 CLIP 做全量微调成本高昂且容易灾难性遗忘而手工提示工程如a photo of a [CLASS]依赖领域专家且难以覆盖模态差异。CoOp、CoCoOp 等提示学习方法在自然图像上有效但泛化不足XCoOp、DCPL 等医学域探索仅用自然图像 CLIP 主干且任务面窄。从历史视角看提示学习这条技术线经历了清晰的迁移2021 年 CLIP 用对比图文预训练开启零样本分类2022 年 CoOp 把提示变成可学习向量开创少样本提示学习2023–2024 年 CoCoOp、MaPLe、KgCoOp、ProGrad 在条件化、视觉侧提示、正则化上层层加码2024–2025 年 BiomedCLIP、XCoOp、DCPL 把适配带到医学域而 BiomedCoOp 首次用 LLM 提示集成 统计筛选规模化落地——完成从自然图像到医学影像的技术迁移。研究主线从问题到结论图 6BiomedCoOp 研究主线流程图Mermaid基准/方法设计两大组件如何协同BiomedCoOp 的框架设计围绕两个核心组件展开两者共享冻结的 BiomedCLIP 双编码器SCCMSemantic Consistency by Contextual Mapping语义一致性上下文映射用 GPT-4 按查询模板给出 [类别] 在 [模态] 中的 N 种视觉判别特征描述生成 50 条类级医学提示编码后取平均得到通用医学语义锚点 $\bm{P_g}$再用 MSE 损失 $\mathcal{L}{\text{SCCM}}\sum{i}|\bm{T_p}^{(i)}-\bm{P_g}^{(i)}|_2^2$ 把可学习上下文 $\bm{T_p}$ 拉向该锚点确保学到的是通用医学知识而非个别病例特征。KDSPKnowledge Distillation with Selective Prompting选择性提示知识蒸馏先计算图像与提示的相似度得分 $S\frac{1}{B}\sum_{i}\max_j(\beta \cdot \bm{T_g}^{(j)}\cdot \bm{V}^{\intercal})$再用中位数绝对偏差MAD计算修正 z 分数 $z(S-M_s)/D$只保留 $|z|\zeta_s$ 的高质量提示作为教师分布最后用 KL 散度对齐学生可学习上下文与教师筛选后 LLM 提示的 logits防止模型漂移到无关语义空间。总损失为 $\mathcal{L}\mathcal{L}{\text{CE}}\lambda_1\mathcal{L}{\text{SCCM}}\lambda_2\mathcal{L}_{\text{KDSP}}$其中 $\lambda_1$、$\lambda_2$ 为平衡权重。图 1BiomedCoOp 框架总览LLM 查询 可学习上下文 BiomedCLIP 编码经提示集成与师生对齐实现少样本医学分类方法分类全景三层次技术栈图 7BiomedCoOp 方法分类全景图Mermaid方法细节四个核心设计要素模态感知的 LLM 提示查询查询中显式标注成像模态如 MRI、超声因为某些类别在不同模态下语义可能重叠模态感知提示提升了提示多样性是零样本性能提升的关键来源10→50 条提示时 K0 准确率提升约 5pp。统计选择性提示用修正 z 分数 中位数绝对偏差识别离群提示最优阈值 $\zeta_s$ 稳定落在 [1.25, 1.5]在防止过专化与保留通用知识之间取得平衡。知识蒸馏对齐KL 散度约束学生分布贴近筛选后的教师分布避免学习上下文漂移到与真实医学扫描无关的语义空间。轻量上下文初始化以a photo of a的嵌入初始化 4 个 token学习率 0.0025、batch size 4、SGD 优化器few-shot 训练 100 epoch、base-to-novel 50 epoch单张 A10040GB即可完成。实验设计与结果11 个数据集上的全面评测评测协议少样本分类每类 $K1,2,4,8,16$ 张标注训练3 次随机采样取均值Base-to-Novel 泛化16-shot 训练基类评测基类 未见新类用调和平均HM衡量数据集11 个数据集覆盖 9 种模态、10 个器官——肾脏 CTCTKidney 4 类、皮肤镜DermaMNIST 7 类、内镜Kvasir 8 类、眼底RETINA 4 类、组织病理LC25000 5 类、CHMNIST 8 类、脑 MRIBTMRI 4 类、OCTOCTMNIST 4 类训练样本超 9.7 万张、乳腺超声BUSI 3 类、胸部 X 光COVID-QU-Ex 4 类、膝关节 X 光KneeXray 5 级骨关节炎基线CoOp、CoCoOp、ProGrad、KgCoOp提示学习、CLIP-Adapter、Tip-Adapter、Tip-Adapter-F适配器、Standard LP、LP线性探测全部使用 BiomedCLIP 主干。主结果11 数据集平均准确率 %方法K1K4K8K16CoOp50.1659.7565.8469.62CoCoOp48.4954.6961.0865.09KgCoOp50.8557.8262.0862.84ProGrad51.8860.4265.6167.13Tip-Adapter-F51.1761.2365.9170.91BiomedCoOp本文57.0363.9568.3272.42BiomedCoOp 在所有 shot 设置下均排名第一K1 比 ProGrad 高 5.2ppK16 比 Tip-Adapter-F 高 1.5pp。图 2不同少样本方法随 K 增加的平均准确率曲线BiomedCoOp 全程领先且提升稳定Base-to-Novel 泛化10 个数据集BUSI 因类别不足排除平均Base 76.26、Novel 73.92、HM75.07全面超越最强基线 ProGradHM 67.43。在困难数据集上增益更大CTKidney 新类 78.94 vs CoOp 67.9211.0ppKvasir 高 5–10ppLC25000 新类 97.00HM 95.36。零样本配置同样受益LLM 提示集成 52.27% vs 原始 BiomedCLIP 42.05%10.2pp选择性集成进一步提升至 53.72%。组件消融谁在起作用BiomedCLIPSCCMKDSPBaseNovelHMK16✓✗✗73.8564.7567.2369.62✓✓✗75.2165.7970.1969.99✓✗✓75.7472.9174.3071.79✓✓✓76.1173.2274.6472.42KDSP 单独使 Novel 提升 8.2pp防遗忘、保泛化SCCM 提升 Base 适配精度两者叠加最优——互补性得到逐一验证。图 3gScoreCAM 显著性图手工提示聚焦全局模态提示集成信号冲突聚焦背景BiomedCoOp 聚焦病灶区域可解释性与超参数分析视觉可解释性gScoreCAM手工提示聚焦全局模态特征简单提示集成信号冲突、注意力落到背景BiomedCoOp 精准聚焦病灶乳腺超声肿瘤、胸部 X 光感染区域证明学习到的上下文编码了医学判别特征。选择阈值 $\zeta_s$阈值过小知识不足过大则低质量提示混入导致新类过拟合新类准确率在最优阈值1.25–1.5处达峰。骨干消融BiomedCLIPViT-B/1616-shot 达 72.42%显著超过通用 CLIP、PubMedCLIP、PMC-CLIP验证 1500 万图文对医学预训练的价值。图 4KDSP 选择阈值 $\zeta_s$ 对 Base-to-Novel 的影响最优值落在 [1.25, 1.5]图 5不同 CLIP 主干下的 BiomedCoOp 少样本准确率BiomedCLIP 在全部 shot 设置中最高结果对比总结图 8BiomedCoOp 结果对比总结图Mermaid关键发现16-shot 平均准确率72.42%在所有 shot 设置K1 到 K16均排第一K1 时 57.03% 超 ProGrad 5.2pp。Base-to-Novel 调和平均75.07超最强基线 ProGrad 7.6pp新类准确率 73.92验证了对未见疾病类别的泛化能力。零样本准确率从42.05% 提升至 52.27%10.2pp选择性集成进一步到 53.72%——仅靠 LLM 提示即可显著增强分类。KDSP 组件单独使 Novel 提升8.2pp64.75→72.91证明统计离群剔除有效防止过专化与知识遗忘。困难数据集增益更大CTKidney 新类78.94%比 CoOp 高 11.0ppLC25000 新类 97.00%HM 95.36%。提示数从 10 增至 50 时K0 准确率提升约5pp47.55→52.27提示多样性是低样本泛化的关键。按创新模式框架ResearchStudio-Idea分析本文同时命中P13 条件化适配冻结主干4 token、P7 制造监督信号LLM 提示作教师与P2 替换算子统计筛选替换手工模板三类模式且组件消融逐一验证独立贡献——典型的实测而非假设的执行质量。局限性仅文本侧提示不动视觉编码器视觉侧适配如 MaPLe 式联合提示空间未探索。依赖 LLM 生成质量提示由 GPT-4 生成API 成本与封闭模型的复现性都是落地障碍。个别数据集仍难泛化OCTMNIST 新类仅 50.07%HM 61.69 落后 KgCoOp 0.08pp泛化上限受数据分布限制。评测范围11 个公开数据集真实临床多中心验证尚未开展作者展望扩展到更多模态与疾病结合视觉侧提示与深提示并推动临床大规模验证。常见问题FAQBiomedCoOp 与 CoOp 有什么区别CoOp 把提示模板换成可学习的上下文向量但仍基于自然图像 CLIP 且提示单一BiomedCoOp 首次在医学专用 BiomedCLIP 上做提示学习用 GPT-4 生成 50 条模态感知提示作为教师信号并用 MAD 统计筛选剔除离群提示兼顾准确率与泛化。为什么用 LLM 生成提示而不是手工设计医学影像的判别特征细微且跨模态差异大手工提示难以覆盖GPT-4 在临床病例描述上表现可靠生成的提示多样化且模态感知零样本准确率提升 10.2pp 验证了其有效性。KDSP 的统计筛选是如何工作的对每个 LLM 提示计算图像-提示相似度得分用中位数绝对偏差求修正 z 分数剔除 |z| 超过阈值 $\zeta_s$1.25–1.5的离群提示只保留分布内的提示作为蒸馏教师防止过专化到个别疾病状态。BiomedCoOp 需要多少标注数据最少每类 1 张K1 时 57.03%推荐 16-shot72.42%所有实验只训练 4 个上下文 token冻结 BiomedCLIP 主干训练 100 epoch 单张 A100 即可完成。代码开源了吗是的官方实现开源在 https://github.com/HealthX-Lab/BiomedCoOp 支持复现 11 个数据集的少样本与 Base-to-Novel 实验。参考链接arXiv 论文页BiomedCoOp: Learning to Prompt for Biomedical Vision-Language Models (2411.15232)官方代码HealthX-Lab/BiomedCoOp (GitHub)CVPR 2025 Open Access论文全文 (pp. 14766–14776)CLIPLearning Transferable Visual Models From Natural Language Supervision (ICML 2021)CoOpLearning to Prompt for Vision-Language Models (IJCV 2022)BiomedCLIPa multimodal biomedical foundation model (JAMIA 2024)给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
返回列表