尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Accelerating Streaming Video Large Language Models via Hierarchical Token Compression

Accelerating Streaming Video Large Language Models via Hierarchical Token Compression 文章主要内容与创新点总结一、主要内容本文针对流式视频大语言模型(Streaming VideoLLMs)在实时部署中面临的高计算成本问题展开研究。这类模型在处理连续视频流的密集视觉令牌时,存在两大核心瓶颈:一是视觉Transformer(ViT)编码阶段中,时间相似帧的冗余处理导致效率低下;二是LLM预填充阶段令牌序列膨胀,加剧延迟和内存开销。为解决上述问题,作者提出了流式令牌压缩(STC)框架,这是一种即插即用的分层加速方案,可无缝集成到现有流式VideoLLMs中,同时优化ViT编码和LLM预填充两个阶段。STC包含两个核心模块:STC-Cacher:通过缓存和复用时间相似帧的特征,减少ViT编码开销,仅对动态令牌进行选择性计算,避免冗余运算;STC-Pruner:基于空间和时间相关性筛选最显著的令牌,在视觉令牌进入LLM前进行压缩,缩短预填充序列长度。作者在5个基准测试集上对4种基线流式VideoLLMs进行了大量实验,结果表明STC在保持高准确性(如在ReKV框架上保留99%准确率)的同时,显著降低了延迟——ViT编码延迟减少24.5%,LLM预填充延迟减少45.3%,且与端到端在线模型(如Dispider、LiveCC)和离线转在线框架(如ReKV)均具有良好兼容性。二、创新点针对性解决流式场景核心瓶颈:首次明确流式视频的两大特性(ViT编码中的时间冗余、无全局视频信息
返回列表