尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

【ICLR 2025】ECALP:高效上下文感知标签传播,零/少样本免训练视觉语言模型自适应|从免训练VLM适配视角

【ICLR 2025】ECALP:高效上下文感知标签传播,零/少样本免训练视觉语言模型自适应|从免训练VLM适配视角 摘要本文解读 ICLR 2025 论文《Efficient and Context-Aware Label Propagation for Zero-/Few-Shot Training-Free Adaptation of Vision-Language Model》。该论文提出ECALP高效上下文感知标签传播通过融合迭代标签传播、动态图扩展与上下文感知边重加权把视觉语言模型VLM的零样本与少样本下游适配统一为图上的免训练推理全程无需任务级超参数调整。其特别之处在于不需要 ZLaP 那样的额外无标注支持集也不需要 DMN 那样的测试集调参仅用固定超参即可在 11 个细粒度基准上取得 64.00%RN50与 70.54%ViT-B/16的平均精度同时比需训练方法快 30 倍以上并可即插即用于 CLIP、BLIP、BLIP-2、ALBEF 等多种视觉语言模型。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQECALP 是什么方法ECALP 与 ZLaP 的区别是什么ECALP 需要训练吗ECALP 需要为每个任务调超参数吗ECALP 可以用于其他视觉语言模型吗ECALP 的推理速度有多快参考链接论文基本信息项目内容标题英文Efficient and Context-Aware Label Propagation for Zero-/Few-Shot Training-Free Adaptation of Vision-Language Model标题中文高效上下文感知标签传播零/少样本免训练视觉语言模型自适应作者Yushu Li, Yongyi Su, Adam Goodge, Kui Jia, Xun Xu机构华南理工大学 · A*STAR I2R · 香港中文大学深圳 · 上海人工智能实验室会议ICLR 2025arXivhttps://arxiv.org/abs/2412.18303项目网站https://github.com/Yushu-Li/ECALP背景与动机为什么 VLM 适配需要免训练、免调参的范式大规模预训练的视觉语言模型如 CLIP在零样本分类上很强但在细粒度场景Fine-grained与分布偏移Distribution Shift下性能显著下滑。现有的适配路线主要有两条Prompt 调优CoOp、CoCoOp 把静态文本提示替换为可学习的词向量TPT、SwapPrompt 在零样本场景通过增强图像的对比学习生成伪标签。问题在于需要穿过完整计算图反向传播单样本推理耗时达到数百毫秒到数秒级。Adapter 调优CLIP-Adapter、Tip-Adapter 用轻量适配器改写特征DMN、TDA 通过构建测试样本记忆库扩展到零样本。问题在于DMN 融合三支分类器时需要任务特定系数论文原文中 DMN* 甚至借助测试集真值做穷举搜索去掉搜索后性能下降超过 1 个百分点且引入数据增强与重复处理成本。第三条路线是标签传播Label PropagationZLaP 是第一个把标签传播用于 VLM 零样本分类的工作但存在三个关键缺陷——闭环解需要昂贵的拉普拉斯矩阵求逆ImageNet 5 万测试样本规模下不可行、静态图依赖外部无标注数据集、完全没有利用测试样本自身的流形结构。ECALP 的定位以统一的图上标签传播视角解决上述全部问题——迭代解替代闭环求逆、动态图扩展支持流式归纳推理、上下文感知重加权校准相似度度量最终实现免训练、免调参、无外部数据的最优性能。研究主线从问题到结论图 8ECALP 研究主线Mermaid 流程图——从适配痛点经图建模、动态扩展与上下文重加权到全面 SOTA 与可插拔部署基准/方法设计ECALP 的核心是把下游任务的全部数据建模为一张图节点 文本提示原型 $\mathcal{P}$ 少样本样本 $\mathcal{D}_l$可选 未标注测试样本 $\mathcal{D}_u$边 跨模态分离的 KNN 相似度每个测试样本连接 3 个文本邻居、8 个测试库邻居、8 个少样本邻居。标签从确定性的原型与少样本节点出发沿图结构传播到测试节点。图 1ECALP 整体框架——文本提示、少样本样本与测试样本共同建图新样本到达时动态扩展图并做上下文感知边重加权迭代标签传播输出全部测试样本的预测分类全景图 9ECALP 三大核心组件Mermaid 分类图方法细节迭代标签传播替代闭环解。经典标签传播的闭环形式是 $Y^{\infty}(\mathbb{I}-\alpha\tilde{W})^{-1}Y^0$需要共轭梯度法求解线性系统ECALP 改用迭代形式 $Y^{t1}\alpha\tilde{W}Y^t(1-\alpha)Y^0$每轮传播后强制重置文本原型与少样本样本的标签$Y^{t1}_pY^0_p$、$Y^{t1}_lY^0_l$防止测试伪标签回传污染种子节点。迭代 $T3$ 轮后取 $\arg\max$ 得到预测。动态图扩展支持归纳推理。静态构图复杂度为 $O(d \cdot N_v^3 N_v^2\log N_v)$ECALP 对每个新到的测试样本只更新其 KNN 邻域边总复杂度降到 $O(d \cdot N_v^2)$。推理时复用上一测试样本的衰减伪标签 $\hat{Y}{ui}\beta Y^T{uic}$ 作为增量初始化$\beta0.2$加速收敛。上下文感知边重加权。视觉编码器特征中混有背景、风格等与任务无关的信息。ECALP 计算文本提示的逐维均值 $\mu^p_c$ 与方差 $\sigma^p_c$方差大的维度判别力强予以放大——测试样本与文本原型的边权重为 $W^{u}{ij}u_i^{\top}\mathrm{Norm}(\mathrm{diag}(\sigma^p)u_j)$对少样本特征则取方差的倒数$\mathrm{diag}(1/\sigma^{l})$因为少样本中高方差维度代表类内噪声需要抑制。最后对邻接矩阵做幂次稀疏化 $W{ij}W_{ij}^{\gamma}$$\gamma10$剪除低置信边再对称归一化 $\tilde{W}D^{-1/2}WD^{-1/2}$。固定超参$k_P3$、$K_{D_u}8$、$K_{D_l}8$、$\gamma10$、$\beta0.2$、$\alpha1.0$、$T3$——全部实验共用不做任务级搜索。实验设计与结果评测覆盖三大类共 30 场景11 个细粒度基准ImageNet、Flowers102、DTD、OxfordPets、StanfordCars、UCF101、Caltech101、Food101、SUN397、FGVCAircraft、EuroSAT、4 个风格迁移基准ImageNet-A/V2/R/Sketch、ImageNet-C 的 15 种损坏类型以及 $[1,2,4,8,16]$ shot 少样本设置。主干为 CLIP-RN50 与 ViT-B/16。零样本细粒度分类主结果平均精度方法RN50ImageNetDTDUCF101均值CLIP-RN5058.1640.3758.8456.04DMN62.0250.5364.0262.02ZLaP†62.2042.7962.8159.06ECALP62.6454.4966.6764.00方法ViT-B/16ImageNetDTDUCF101均值DMN70.5154.8571.9569.29ZLaP†70.1748.5871.4567.72ECALP71.2656.3275.4470.54† ZLaP 需要额外的无标注训练集数据DMN* 使用测试集真值做融合系数穷举搜索不在直接对比之列。图 2少样本自适应——1/2/4/8/16 shot 下 ECALP 一致优于 DMN、APE、Tip-Adapter、TIP-X 等免训练方法所有基线均用默认超参数不做搜索风格迁移与 OOD 结果ViT 主干风格迁移均值 64.92%TDA 63.89、DMN 63.80RN50 均值 47.73%较 CLIP 平均提升约 7 个百分点甚至优于需训练的 CoOp/CoCoOpImageNet-C 的 15 种损坏类型中ViT 均值 29.50TDA 28.3414 项拿到第一。消融研究ImageNet仅标签传播 55.34较 CLIP 的 58.16 略降文本提示重加权 62.647.30少样本路径LP少样本 47.25少样本重加权 63.47全组件 ECALP-FS 63.20/65.37/74.44ImageNet/DTD/UCF。子图消融显示测试-原型边 $W_{up}$ 收益最大测试内部边 $W_u$ 在 DTD 上带来 52.42→54.49 的提升验证测试流形的价值。图 3动态图扩展约 6 倍加速复杂度 $O(d \cdot N_v^2)$ vs $O(d \cdot N_v^3N_v^2\log N_v)$支撑 5 万测试样本规模的流式推理计算效率ImageNet单样本耗时CLIP 14.0msTPT 898.7ms需训练DiffTPT 2472.5ms需训练TDA 26.7msDMN 30.1msZLaP 29.3msECALP 28.0ms精度 62.64、增益 4.47 最高——免训练方法整体比需训练方法快 30 倍以上。跨 VLM 泛化ImageNet 精度VLM基线ECALPBLIP53.4058.16BLIP v241.2243.72ALBEF36.1540.31图 4CoOpECALP 在 8/16 shot 反超单独 ECALP说明两者正交互补1-shot 时提示词过拟合略逊图 5多轮迭代优于单轮利用测试流形$T3$ 是精度与效率的平衡点图 6所有严重度1–5下 ECALP 一致领先 CLIP-RN50 约 3–5 个百分点图 7高斯噪声、运动模糊、饱和失真、雪花噪声等极端退化下增益依然稳健其他关键实验KNN 连接数网格研究确认 $k_P3$、$K_{D_u}8$ 最优DTD 54.49%数据流坏初始化鲁棒性测试中前 10% 测试样本全为困难样本时精度仅从 54.49 降至 54.140.4% 损失t-SNE 失败案例分析显示 OxfordPets/Food101 特征混杂、类内子簇多少样本收益有限而 Flowers102/EuroSAT 特征分离清晰、收益明显。结果对比总结图 10零/少样本自适应结果对比总结Mermaid 流程图关键发现零样本全面 SOTA11 个细粒度基准平均精度 64.00%RN50/ 70.54%ViT-B/16分别领先 DMN 1.98 与 1.25 个百分点、领先 ZLaP 4.94 与 2.82 个百分点且全程零任务级调参。固定超参的威力文本邻居 3、测试库邻居 8、$\gamma10$、$T3$ 一组超参横跨 30 场景对比 DMN* 依赖测试集真值搜索融合系数去掉搜索掉 1%。效率数量级优势ImageNet 单样本 28.0ms比需训练的 TPT898.7ms与 DiffTPT2472.5ms快 30–88 倍动态图扩展比静态构图快约 6 倍。上下文重加权是最大单点贡献文本提示重加权带来 ImageNet 7.30 个百分点55.34→62.64证明测什么比怎么传更关键。模型无关可插拔BLIP 4.76、BLIP-2 2.50、ALBEF 4.16ImageNet且与 CoOp 结合在 8/16 shot 进一步反超——任何 VLM 特征都能直接建图传播。鲁棒性15 种损坏类型、5 级严重度下全部领先 CLIP 约 3–5%10% 困难样本坏开局精度损失 0.4%。局限性少样本长尾失效OxfordPets、Food101 测试特征混杂t-SNE 显示类内孤立子簇多少样本监督收益有限。极端 1-shot 场景CoOpECALP 在 1-shot 低于单独 ECALP——提示词过拟合损害传播。迭代开销权衡$T$ 增大使标签矩阵变密精度与计算需平衡论文选 $T3$。KNN 敏感性性能对近邻数有一定敏感度$k_P3, K_{D_u}8$ 最优需配合固定超参约定使用。常见问题FAQECALP 是什么方法ECALPEfficient and Context-Aware Label Propagation是一个免训练、免调参的 VLM 下游适配方法把文本提示、少样本样本与测试样本建成图用迭代标签传播做推理配合动态图扩展与上下文感知边重加权。ECALP 与 ZLaP 的区别是什么三点迭代解替代闭环拉普拉斯求逆避免昂贵矩阵求逆、动态图扩展替代依赖外部数据集的静态图不需要额外无标注支持集、上下文感知重加权替代原始余弦相似度更好对齐下游任务。ECALP 需要训练吗完全不需要。所有组件KNN 建图、幂次稀疏化、归一化、迭代传播都是纯图运算不更新任何网络参数只做一次特征提取。ECALP 需要为每个任务调超参数吗不需要。论文用一组固定超参$k_P3$、$K_{D_u}8$、$\gamma10$、$\beta0.2$、$\alpha1.0$、$T3$跑完全部 30 场景这是与 DMN依赖测试集搜索融合系数的本质区别。ECALP 可以用于其他视觉语言模型吗可以。论文在 CLIP 之外验证了 BLIP53.40→58.16、BLIP v241.22→43.72、ALBEF36.15→40.31都能显著提升 ImageNet 零样本精度说明方法具有模型无关性。ECALP 的推理速度有多快ImageNet 上单样本 28.0msRTX 3090比需训练的 TPT 898.7ms 快约 32 倍动态图扩展使构图复杂度从 $O(d \cdot N_v^3)$ 降到 $O(d \cdot N_v^2)$。参考链接arXiv 论文页Efficient and Context-Aware Label Propagation for Zero-/Few-Shot Training-Free Adaptation of Vision-Language Model官方实现GitHubECALP 训练与推理代码ZLaPLabel Propagation for Zero-shot Classification with VLMsECALP 的直接前作与最强对比方法DMNDual Modality Prompt Tuning需调参的强基线TPTTest-Time Prompt Tuning测试时提示调优代表工作CLIPICML 2021本文使用的视觉语言模型主干给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
返回列表