尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

英伟达:视频世界模型长程记忆寻址

英伟达:视频世界模型长程记忆寻址 标题Addressable Memory for Video World Models来源arXiv, 2608.07408v1️文章简介研究问题如何在无需重新训练的情况下解决自回归视频世界模型在生成长度超过训练上下文时因位置编码超出分布范围导致的记忆不可寻址及压缩信息损坏问题主要贡献论文提出了WorldTrace一种无需训练的内存框架通过为压缩记忆槽分配固定的虚拟位置保持其可寻址性并引入两种互补的记忆压缩策略以增强视觉持久性。重点思路提出虚拟位置分配机制将KV缓存划分为近期窗口和摘要缓存为每个摘要槽分配基于槽排名的固定虚拟位置确保其在任何生成长度下都处于模型训练见过的位置编码分布内从而保持远距离token的可寻址性。设计WorldTrace-Field策略针对时间连贯性在规范空间去除RoPE旋转中对连续时间组的键进行平均再重新旋转到虚拟位置避免相位抵消保留历史信息的粗略场。设计WorldTrace-Landmark策略针对情景回忆检测场景入口帧并冻结其规范键作为地标存储于摘要槽中通过单次旋转匹配当前虚拟位置实现关键场景的精确召回。构建LoopBench基准设计包含不同拓扑结构、路径长度和相机朝向的循环导航任务评估压缩缓存在长距离绕行后重建先前访问场景的能力。分析总结位置分配是关键瓶颈实验表明即使内容压缩得当若位置分配导致偏移量超出训练分布如Block-relative方法记忆仍无法被有效读取WorldTrace的槽排名位置分配显著优于其他基线。规范空间压缩避免信号损坏在RoPE旋转空间直接平均会导致不同相位的向量相互抵消而在规范空间平均能保留低频内容显著提升时间一致性。显著提升长程生成质量WorldTrace-Field在长序列生成中将时间一致性提升了15.5%WorldTrace-Landmark在LoopBench上将情景回忆准确率提升了19.5%且在极长序列中仍能保持高保真度的场景重建。无需重训即可扩展记忆视界该方法在不增加GPU显存峰值且无需微调模型参数的情况下有效延长了视频世界模型的视觉持久性生成能力。个人观点论文揭示了长程生成失败的本质不仅是“存不下”更是“找不到”和“读不懂”。它解耦了位置寻址与内容压缩两个问题通过虚拟位置映射解决了RoPE外推失效的痛点并通过规范空间操作解决了相位干扰问题。
返回列表