
文章总结与翻译一、主要内容本文聚焦视频大语言模型(VideoLLMs)中的时间幻觉问题,提出了一种无需训练的自诊断对比解码方法(SEASON),旨在同时提升模型输出的时间一致性和空间真实性。核心背景视频大语言模型在视觉-语言任务中取得显著进展,但易产生与视频内容不一致的幻觉,尤其时间幻觉(事件顺序、因果关系错误)未被充分研究,而现有方法多关注空间幻觉(物体或属性 mismatch)。现有解决方案中,训练型方法需昂贵的重训练和高质量偏好数据,无训练方法(如DINO-HEAL、TCD)难以捕捉复杂时间关系和因果逻辑。方法架构时间同质化(Temporal Homogenization):构建时间负样本(v T v^Tv