这项由台湾阳明交通大学多位研究人员联合完成的研究发表于2026年7月的SIGGRAPH Conference Papers会议时间为2026年7月19日至23日在美国洛杉矶举行论文编号为DOI 10.1145/3799902.3811151arXiv编号2607.08770。感兴趣的读者可通过上述编号查阅完整原文。手机拍视频时如果拍摄对象动得太快——比如飞速旋转的风扇叶片、高速行驶的赛车——画面往往会变得模糊一片这是因为普通相机有个天然的短板它每隔固定时间才咔哒一声拍一帧动得太快的东西就会留下残影。科学家们因此发明了一种事件相机它不按固定节拍拍照而是像人眼神经一样只要某个像素点的亮度发生了变化就立刻记录下来精度可以达到百万分之一秒。这种相机在高速运动、强光弱光交替的场景下表现出色是无人机导航、高速机器人视觉等领域的理想传感器。然而事件相机有一个令人头疼的问题它输出的不是普通照片或视频而是一串稀疏的亮度变化信号和人类习惯看到的画面格格不入现有的大多数计算机视觉算法根本看不懂这些数据。如何把这些零散的信号还原成人眼可以欣赏的高质量视频一直是这个领域的核心挑战。更难的是不同任务对这些信号的处理方式也不一样——有时候我们只有事件信号想从头重建画面有时候我们有起始帧想预测接下来会发生什么还有时候我们有开头和结尾两帧想补出中间过渡的画面。过去这三件事往往需要三套不同的系统来分别处理既麻烦又低效。台湾阳明交通大学的这支研究团队提出了一个名为LongE2V的方法核心思路是借助已经在海量视频数据上训练好的视频扩散模型——一种能够凭借丰富的视觉经验生成和补全视频的AI系统——来同时解决上面三个问题并专门设计了一系列配套机制让生成的视频在极长序列下也能保持稳定、不漂移、不出现鬼影。一、从模糊到清晰现有方法为什么总差那么一口气要理解这项研究解决了什么先得知道之前的方法卡在哪里。过去最主流的做法是用回归模型来处理事件相机数据。所谓回归可以这样理解假设你要猜一个人的身高你把所有可能的身高都投票给一个最稳妥的中间值结果虽然不会太离谱但也很难非常准确。把这个逻辑用到视频重建上模型会倾向于生成一个取悦大多数可能情况的画面也就是说它会把细节磨平生成一张看起来差不多但其实哪里都不够清晰的模糊图像。就像让一个画师凭记忆临摹一幅他没见过几次的画他画出来的往往是一个模糊的轮廓而不是精确的细节。这种现象在学术上叫回归均值是导致E2VID等经典方法画面模糊的根本原因。近年来扩散模型在图像和视频生成领域大放异彩它的原理更像是一位有丰富绘画经验的艺术家在大量真实图像的熏陶下它学会了什么样的画面是真实、合理、细节丰富的所以在补全或重建图像时它会主动填充合理的细节而不是简单取个平均值。把扩散模型用于事件相机视频重建理论上可以突破模糊的瓶颈。但问题随之而来。当需要处理的不是短短几帧而是成百上千帧的长序列时扩散模型会出现严重的时间漂移现象。可以用一个比喻来理解假设你在玩一个接龙游戏每次都用上一个人说的最后一个词接下去起初还好但随着接龙越来越长每个人的小偏差都会被累积放大最终说出来的话和开头已经完全风马牛不相及。扩散模型在长视频生成中也是如此——它用自己生成的上一段作为下一段的参考每一段的小误差都会在下一段被继承甚至放大久而久之颜色偏了、结构乱了、人物飘移了这就是所谓的错误累积与时间漂移。另外在视频帧插值补中间帧这个任务上已有方法在大幅度运动场景下容易出现鬼影——同一个运动物体在画面里出现了两个半透明的轮廓像是照片曝光过度时的重影严重影响视觉效果。LongE2V正是为了同时解决这三个问题而诞生的。二、借力打力用现成的视频大脑处理事件相机信号这支研究团队的核心策略是不从零开始训练一个全新的AI而是站在巨人的肩膀上。他们选择了CogVideoX这个已经在大规模视频数据上训练好的视频扩散模型作为自己系统的大脑底座。这个底座的价值在于它已经从海量真实视频中学到了现实世界的视觉规律——物体在运动时应该是什么样子、光影是怎么变化的、细节应该如何分布。有了这个基础研究团队只需要再用相对少量的事件相机数据进行微调就能让这个大脑理解事件信号的语言而不需要从头喂给它数以亿计的训练样本。这就像一个已经会说英语和法语的人学西班牙语比一个从零开始学外语的人要快得多、学得也好得多。在技术实现上事件相机产生的信号首先被整理成一种叫事件体素的格式——把一段时间内的亮度变化信号按时间分成若干层叠成一个三维数据块。研究团队把这个数据块设置成三层恰好可以像普通RGB三通道图像一样被标准的图像编码器处理这个小巧思省去了专门设计新编码器的麻烦。在模型的输入端系统同时接收三类信息当前时间窗口的事件体素、一帧起始参考帧告诉模型现在世界长什么样以及前一段视频作为历史上下文告诉模型刚才发生了什么。这三类信息经过各自的编码处理后在特征空间中拼接在一起送入扩散模型进行视频生成。为了让扩散模型能处理多出来的事件通道团队对模型的第一个投影层进行了扩展并用LoRA一种高效的低秩微调技术相当于只调整模型中少数几个旋钮而不是全部重新拧一遍来微调主干网络大大降低了训练成本。三个不同任务共用同一套权重通过改变输入条件来切换纯事件信号输入就是视频重建加上起始帧就是视频预测同时给出起始帧和结束帧就是帧插值。这种一套系统、三种用途的设计是LongE2V在灵活性上的重要优势。三、防止跑偏让长视频保持稳定的两把钥匙解决了单段视频的质量问题之后更大的挑战出现了如何让几百帧乃至几千帧的长视频保持始终如一的稳定研究团队为此设计了两套机制可以把它们理解为纠偏系统的两个组成部分。第一套机制叫自回归展开训练。这个名字听起来复杂背后的道理却很朴素。在训练阶段模型最初是喂给它完美的、真实的前一段视频作为历史上下文这当然没问题。但在实际使用时哪里来的完美的前一段前一段本身就是模型自己生成的多少会有些误差。如果模型只见过完美的历史突然要面对自己生成的不完美历史就会手足无措错误会迅速放大。于是训练团队在模型基本学会基础技能之后引入了一个自我对抗的训练阶段先用模型对训练集生成一遍预测结果然后把这些有误差的生成结果当作历史上下文继续训练模型。这个过程重复进行三轮每一轮模型都在适应自己可能犯的错误慢慢地学会在不完美的历史下依然生成稳定的结果。这就像一个厨师起初只用最好的食材练手后来刻意用卖相普通的食材反复练习最终无论食材好坏都能做出美味的菜肴。第二套机制叫自适应上下文切换。即便有了自回归训练的加持错误依然可能在极长序列中缓慢累积。这套机制的作用是动态判断当前生成的这一段是否真的还在借鉴历史上下文如果历史上下文已经和当前内容脱节了模型注意力几乎不再看历史了那就主动触发一次上下文更新——用刚生成的这段替换掉过时的历史重新校准。具体判断方法是在扩散模型内部每个注意力层都有一个注意力权重矩阵记录着当前帧在生成时有多依赖历史上下文帧。研究团队计算出所有层、所有注意力头上当前帧对历史帧的平均注意力权重。当这个数值低于0.05时说明历史上下文已经失去了参考价值系统就丢弃当前生成结果更新历史上下文然后重新生成。这就像一个导航系统不是每隔固定时间就重新规划路线而是在发现当前地图和实际道路不符了的时候才触发重新规划既避免了过度更新带来的不连贯也防止了长时间不更新导致的偏航。四、补帧的精妙解决正放和倒放之间的时间错位帧插值任务有一个独特之处——给了开头帧和结尾帧要补出中间的过渡。一种自然的思路是从开头往后生成一遍正向分支再从结尾往前生成一遍反向分支然后把两遍的结果融合起来取长补短。但这里藏着一个不易察觉的技术陷阱。扩散模型内部会把视频帧编码成一种压缩的潜在表示可以理解为视频的浓缩精华版本而这个编码过程是有时间结构的——它按顺序压缩帧前后帧之间存在依赖关系就像用特定方式折叠好的纸顺序不能乱。如果想把反向分支的结果拿来和正向分支对齐直接在浓缩精华层面做时间翻转得到的结果和先把视频翻转再重新压缩的结果是不一样的。换句话说在压缩空间里翻转和在原始画面空间里翻转不是同一件事——这个不等式是导致两个分支产生错位的根本原因。为了解决这个问题研究团队提出了重编码对齐方案不要在压缩空间里直接翻转而是先把压缩后的结果解码回真实画面在真实画面层面做时间翻转然后再重新压缩。虽然多了解码和重压缩两步但这样得到的翻转结果和直接翻转视频再压缩是等价的两个分支之间的时间对齐就此保证。不过解码和重新压缩的过程本身会造成一定的信息损失——就像把一张照片从JPEG解压再重新压缩每次都会损失一点细节。为了弥补这个损失研究团队又提出了交叉残差修正方案分别计算正向和反向分支在压缩前后的差值即损失掉的细节信息然后把正向分支的差值注入到反向分支对齐后的结果里同时把反向分支的差值注入到正向分支里。这样两个分支互相帮对方补回在重压缩时丢失的细节还顺带增强了两个分支在时间上的一致性——因为互相交换了细节信息两个分支对同一时刻的理解会更加接近。最终两个经过修正的分支通过加权混合靠近起始帧时更信任正向分支靠近结束帧时更信任反向分支融合成最终的插值结果。五、让模型适应不同相机事件体素密度增强事件相机有各种不同的分辨率和型号不同相机在同样的运动场景下产生的事件数据密度可能差异很大。如果模型只见过某种固定密度的事件数据换一台相机就可能表现大幅下滑。为了增强泛化能力研究团队设计了一种密度增强策略在训练时随机对事件体素进行缩放缩放比例在合理范围内随机选取然后随机裁剪出目标尺寸。这样模型在训练过程中见过各种不同密度的事件数据对密度的变化就不那么敏感了。同时为了保证事件数据和视频帧之间的空间对齐对事件体素的缩放和裁剪操作会同步施加到对应的视频帧上确保两者始终一一对应。此外在归一化处理时参照了FireNet的方法只基于非零值的统计量进行归一化以保留事件数据天然的稀疏性特征。六、实验结果在三个任务上全面超越前辈研究团队在多个真实世界数据集上对LongE2V进行了全面评测。训练数据仅使用了BS-ERGB数据集的训练集共7636帧规模相当小但测试则覆盖了ECD、MVSEC、HQF三个完全不同的数据集序列长度从约300帧到2740帧不等充分考验了模型的泛化能力和长期稳定性。在视频重建任务上LongE2V在全部三个数据集上均取得了最佳的LPIPS指标这个指标衡量的是人类对图像质量的感知分数越低越好。与回归类方法相比LongE2V重建出的画面细节更丰富、纹理更清晰不再是那种哪里都差不多但哪里都不清楚的模糊感。在PSNR峰值信噪比和SSIM结构相似性指标上LongE2V也与最强的回归类基线HyperE2VID持平甚至超越。在视频预测任务上与唯一的扩散模型类对手VDM-EVFI相比LongE2V的优势非常显著。以ECD数据集为例PSNR从20.33提升到24.40SSIM从0.614提升到0.771LPIPS从0.244降低到0.110三项指标全线大幅领先。更直观的是在处理HQF这类长达2430帧的超长序列时VDM-EVFI的画面会出现明显的颜色漂移和结构崩塌而LongE2V始终保持稳定的视觉质量。在帧插值任务上LongE2V没有进行任何专门的微调直接用重建和预测任务训练好的权重在零样本的条件下与专门为帧插值设计并经过有监督训练的CBMNet-Large和TLXNet进行比较。结果是在BS-ERGB测试集上LongE2V的LPIPS0.124显著优于CBMNet-Large0.170和TLXNet0.226在HQF数据集上LongE2V的全部三项指标均为最佳PSNR 25.39SSIM 0.800LPIPS 0.105。在处理大幅运动的真实场景时CBMNet-Large出现了严重的鬼影和颜色错误TLXNet则结构崩塌而LongE2V在零样本条件下依然给出了清晰、连贯的插值结果甚至连画面中的文字细节都能清晰辨认。七、额外能力与局限性在训练时以20%的概率引入文本提示之后LongE2V获得了一项额外能力文本引导的事件视频着色。事件相机本身只记录亮度变化生成的重建视频是灰度的但当用户提供一段文字描述比如这个场景中央是一个五彩缤纷的积木结构……模型能够在保持事件数据决定的结构和运动的前提下按照文字的描述给画面上色实现灰度事件视频到彩色视频的自动转换。通过XT切片即把视频某一行像素在时间轴上的变化展开成一张图可以验证上色后的视频在时间上是连贯的不会出现颜色一帧一帧地乱跳。在速度方面LongE2V每秒处理约0.28帧即生成一帧需要约3.6秒明显慢于E2VID等非扩散类方法每帧约0.0024秒但比同类扩散模型VDM-EVFI每帧约5.4秒快了约1.5倍。这种速度差距在当前阶段对实时应用还有限制但研究团队也指出加速推理是下一步的重要方向。在局限性方面当事件流非常稀疏或质量很差时模型也会力不从心重建出来的画面质量明显下滑。另外事件相机本身存在一种叫热像素的噪声——某些像素点因为硬件缺陷会不断触发错误事件LongE2V对这种噪声比较敏感有时会把噪声当成真实信号保留甚至放大到重建画面中。这两点是当前版本尚未完全解决的问题。说到底这项研究最有意思的地方在于它没有试图从零发明一套全新的AI而是聪明地把一个已经见多识广的视频生成模型改造成了能听懂事件相机语言的视觉专家。通过三套精心设计的配套机制——自回归展开训练、自适应上下文切换、重编码对齐加交叉残差修正——把扩散模型在长视频和精确插值上的短板补了起来。更难得的是整套系统训练数据量极小不到八千帧却能泛化到多个完全不同的测试集在三个任务上都打败了专门针对各自任务设计的对手。对于普通人来说这项技术的潜在影响可能体现在这样一些场景无人机在夜间或强光环境下拍摄的事件相机数据可以被还原成人类可读的高清视频高速运动的体育画面可以被精确补帧不再有鬼影安防摄像头在极端光线条件下采集的事件数据可以被转化为结构清晰的监控画面。当然距离这些应用真正落地还需要解决推理速度慢的问题以及对噪声鲁棒性不足的问题。下一步研究团队计划探索加速推理的方法以及更高效的长期记忆机制让系统在处理更长的视频序列时依然能够保持稳定。---QAQ1事件相机和普通相机有什么根本区别A普通相机按固定节拍拍照每隔固定时间输出一整帧图像事件相机则不拍整帧而是在每个像素点亮度发生变化时立刻记录这个变化事件精度可达百万分之一秒。事件相机在高速运动和强光弱光交替场景下不会产生运动模糊但输出的是稀疏的变化信号而不是人眼可直接看懂的图像需要后续算法重建成视频。Q2LongE2V为什么可以用同一套权重做视频重建、视频预测和帧插值三件事ALongE2V把这三个任务都统一成基于事件信号的条件视频生成通过改变输入条件来区分任务只有事件信号就做重建加上起始帧就做预测同时给起始帧和结束帧就做帧插值。由于底层都是同一个扩散模型在处理事件条件权重可以共享无需为每个任务单独训练一套系统。Q3LongE2V的帧插值为什么是零样本效果却比专门训练的方法还好ALongE2V在训练时只针对重建和预测任务从未用帧插值数据专门训练。它能做帧插值依靠的是重编码对齐和交叉残差修正两套推理时的技巧以及底层扩散模型本身从大量视频数据中学到的丰富视觉先验。对比方法虽然专门训练了帧插值但在大幅运动和真实噪声下容易产生鬼影和结构崩塌而LongE2V的生成式方法在这些困难场景下反而更稳健。