一句话讲清楚南京大学与上海 AI 实验室等提出 TimeLens2 把「证据落在哪几段」当成一组可核对的时间段来标注和训练 4B 模型在七项时序定位基准上平均超过参数量大两个数量级的开源模型。你让模型总结一场九十分钟的球赛它能说出「进球了」却说不清进球在第几分钟。你还得自己拖进度条核对。多模态大模型常卡在这一步会描述却给不出可点开的时间出处。这里的证据往往也不止一段。同一件事可能出现多次问句也可能只对应很短的一块画面。 TimeLens2 要做的是让同一个模型、同一套输出接口在长短视频、单段或多段证据、陈述句或问句、第三人称或第一人称视角里直接给出一组起止时间段。七项基准上的平均重叠分数以及各设定下的代表性查询短动作、事件级、高光、长视频多段、用户风格、问句式与第一人称定位。现有做法对不上任务本身。标注上答案本该是「可能有多段」的时间段集合长视频却常被整段只判一次。相关时刻稀疏、相似干扰很多一次性标注容易认错发生次数、漏掉重复证据或起止偏粗。训练上常规微调多半先学会「把时间写成规定格式」。若接着用时间段重叠比例 tIoU 做强化学习又有个坑预测和答案完全错开时分数一律是 0——偏了两秒和偏了两分钟训练信号看不出差别。多段目标若再强制「预测每一段对上答案每一段」一旦拆开、合并或段数不等分数也容易乱。TimeLens2 从标注到训练都坚持同一约定证据按「一组起止时间段」处理输出也走同一套接口。标注先找对是哪几段再把起止修准TimeLens2-93K 来自按时长分层、领域多样的 YouTube 视频。最终保留 23,793 条视频、 93,232 条定位样本其中 12,091 条带多段证据视频平均时长约 10.2 分钟。数据流水线六步前三步用带时间戳的字幕提出查询与粗略候选段后三步在视频上独立重找、交叉核对并精修边界。流程分两段先造候选再定标签。先按内容把视频切成约 20–60 秒的小段生成全局字幕和片段字幕。再据此写出陈述句式查询例如「找出用到奶酪的所有时刻」并把相关片段当作粗略候选。候选只缩小搜索范围不当最终答案。随后两个看问题方式不同的定位模型 Qwen3-VL-30B-A3B 与 TimeLens-8B 在短片段上各自重找一遍输出一段或多段或明确「找不到」。找不到用来拒绝字幕里站不住脚的候选多段则保留片段内的重复证据。核对也分两层两套时间段整体要足够像合并后交并比高于 0.9 文字和画面语义要对得上嵌入相似度不低于 0.5 。通过后再在每个边界附近 ±3 秒做局部精修并把间隔不超过 1 秒的相邻段合并——这类缝隙更像边界抖动通常不必拆成两段语义事件。长视频仍需要全局上下文来教「怎么搜」但精确起止只能在局部、可核对的决策里长出来。训练先学会去哪找再校准时间段摆得准不准模型基于 Qwen3-VL 的 2B / 4B / 8B 指令版分两阶段训练。第一阶段做长上下文监督微调。样本主要来自 TimeLens2-93K 与 TimeLens-100K 并加入 Ego4D-NLQ 训练集以覆盖第一人称。 4B/8B 打包长度到 100K token 同一条时间段答案会用多种提问措辞和多种时间写法渲染降低「只会模仿某一种输出格式」的风险。第二阶段用 GRPO 一种同组回答互相比好坏的强化学习做校准。奖励由三项组成重叠比例奖励看已经对了多少解析失败惩罚非法输出关键补丁是时间 Wasserstein 奖励 。解决的就是上面那个零分坑先把预测段、答案段各自捏成时间轴上「实际占住的区间」再量两边要搬多远才对齐——完全没叠上时也能分出「差两秒」和「差两分钟」。它不强制段对段配对同一段证据拆成两段或合成一段分数应保持稳定。旧重叠奖励的盲区完全没叠上时近失与远失都是 0 多段场景里它可能偏好只覆盖一段的答案强制段对段配对还会在拆分时制造假分数。诊断结果对得上这份直觉在 4,332 个「重叠为零」的有效预测里加入 后离目标很近的漏检有 21.9% 恢复出正重叠很远的只有 5.7%。训练组里本来整组都是 0 分、分不出好坏的样本中约75.8%又能排出远近。几种「把时间段变成打分分布」的试法都能相对纯重叠奖励带来增益但默认在整段证据时间上均匀摊开最稳平均重叠分数从 47.0 提到 47.7 。它同时保留了证据位置和持续时间而评价本身也在看时间段占用。同一组时间段转成四种打分分布。默认均匀摊开对各项基准最一致。结果超过大模型的是时序定位范围先说清评测覆盖七项基准分别对应短动作、事件、高光、长视频、问句与第一人称等设定含 TimeLens-Bench 重标注集、 VUE-TR / VUE-TR-V2 、 MomentSeeker 、 Ego4D-NLQ 。主指标看平均时间重叠 mIoU 以及 R10.5 最高分预测与答案重叠超过一半的比例。与专有及开源模型对比。 TimeLens2-2B 在同尺寸组全面领先 4B/8B 在多数基准上达到开源最优并超过参数量大得多的模型。几个数字值得单独记住■TimeLens2-2B / 4B / 8B 平均 mIoU 分别为44.5 / 47.7 / 48.0■相对各自 Qwen3-VL 底座提升14.2 / 13.0 / 18.1个 mIoU 点■TimeLens2-4B 平均比 Qwen3.5-397B-A17B 高约7.5点并在全部七项上更高■增益最大的地方往往是难搜场景相对 4B 底座 VUE-TR 19.6 、 VUE-TR-V2 27.8 、 MomentSeeker 12.6 、 Ego4D-NLQ 7.2提升主要来自在长干扰里把该找的证据搜出来短视频边界变细只是附带收益。标题里的「超过 397B 」只成立在这七项时序定位上。若 KPI 是可点击时间戳命中率堆参数不如先把区间集标签与几何奖励做对若 KPI 是开放域闲聊式视频理解这篇数字参考价值有限。定性对比 93.7 分钟视频里的晚发短事件、五段稀疏手铐镜头、依赖 OCR 名单的问句、第一人称取物。 TimeLens2 更完整也更少被相似干扰带偏。定性例子里最难的两类是「晚发短事件」和「多段稀疏证据」。 93.7 分钟视频中目标落在约 4750 秒附近的短窗口对比模型会偏早、偏晚或输出非法时间戳多段场景里它收回全部五段稀疏手铐证据并少塞看起来合理却错误的窗口。另外两类失败也很常见问句需要 OCR 名单片段时对比模型容易框住整场比赛场景第一人称取物时它们又集体滑向更晚的相似交互而 TimeLens2 仍能点到真实动作。消融高质量子集先把「会搜」教会监督阶段单独看用了哪些数据更能分清贡献来自哪里。TimeLens2-93K 在监督训练中的缩放与混合。前 5% 数据就把平均 mIoU 从 34.7 拉到 42.8 完整语料继续加固长视频与第一人称。曲线分两段。 TimeLens2-93K 的前 5% 就把七项平均 mIoU 从底座的 34.7 拉到 42.8 20% 到 45.3 。全量到 45.8 时增量更多落在 VUE-TR-V2 、 Ego4D-NLQ 这类更难设定。规模相近的 TimeLens-100K 单独只有 39.4 。问答轮次差不多可迁移的搜索能力却差一截。另外一个迁移信号 TimeLens2-93K 只有陈述句式查询却把问句式 MomentSeeker 从 15.3 提到 25.8 。增益更可能来自「怎么搜证据」问法模板本身未必被背下来。标签精炼同样体现质量优先。两套模型各自产出的原始标签很多用它们训出的模型七项平均 mIoU 只有 42.0 时间段彼此对得上后样本砍到约 174K 平均 mIoU 升到 43.4 语义校验到 93.2K 到 44.1 同一批标签再做边界精修平均再到 45.8 单阶段 1.7 。数据和奖励两边都在重复同一原则先找对是哪几段再把起止时间修准。边界与判断TimeLens2 解决的是「回答能否在时间轴上被核对」。它不声称替代所有视频问答能力。网页视频上的陈述句数据也带不动第一人称所以最终混合里仍显式加入 Ego4D-NLQ 。定性里仍能看到难例形态证据极晚且极短、多段极稀疏、强依赖 OCR 、第一人称相似交互密集。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】