
OmniZip 论文核心总结与翻译一、主要内容总结OmniZip 是一种面向全模态大语言模型(OmniLLMs)的无训练音频引导式音视频令牌压缩框架,旨在解决 OmniLLMs 处理音视频令牌时面临的计算与内存瓶颈问题。核心背景全模态大语言模型需联合处理音频、视频与文本信息,但音视频令牌数量庞大且存在时空冗余,传统单模态令牌压缩方法无法适配多模态协同压缩需求,导致模型推理效率低下、部署困难。核心机制音频令牌筛选:基于音频编码器的注意力分布识别显著音频令牌,计算每个时间窗口的音频保留分数,以此表征时间维度的信息密度与事件边界先验。音频锚点整合:均匀采样非显著音频令牌作为锚点,通过跨模态相似度筛选与视频高度相关的音频令牌并合并,在保留语义信息的同时维持上下文覆盖度。音频引导视频压缩:根据音频保留分数动态分配视频令牌剪枝率——信息密集窗口采用保守剪枝,稀疏窗口采用激进剪枝;结合交错时空压缩(ISTC)模块,分别处理帧间时间冗余与帧内空间冗余。实验效果在 Qwen2.5-Omni(3B/7B)模型及 AVUT、VideoMME、WorldSense 等基准测试中,OmniZip 实现:推理加速:预填充阶段 2.7-3.8 倍提速,整体推理 1.33