尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

MOSS-VL Technical Report——MOSS-VL 技术报告

MOSS-VL Technical Report——MOSS-VL 技术报告 一、研究定位与核心目标核心定位MOSS-VL是一个开源的视觉-语言模型家族首创性地将“实时交互”作为一等公民能力——即模型能够在生成文本的同时持续感知新到达的视觉帧并在证据变化时动态修正或打断自己的回复。关键突破它跨越了传统流式模型L2-L4层级回复时“失明”与真正的实时交互L5层级生成时持续感知之间的鸿沟。二、技术架构创新三大支柱创新点技术细节设计意图门控交叉注意力仅在12层每4层引入交叉注意力视觉令牌通过tanh门控以键值形式接入从不进入解码序列门控零初始化保证语言骨干完整实现“边生成边感知”新帧仅追加到缓存无需重算XRoPE位置编码首创为交叉注意力通道设计的三轴坐标编码 (t, h, w)文本与视觉共享统一时间线64对旋转频率按(24,20,20)分配赋予视觉流位置信息使时序关系可被模型理解绝对时间戳令牌每帧前插入|time_start|X.X秒|time_end|让模型直接读取挂钟时间而非从位置推断适应可变帧率参数规模总计113亿参数语言骨干约82亿 交叉注意力约23亿 视觉编码器/投影约8亿。三、训练课程设计六阶段递进阶段名称令牌数最大序列可训练模块学习率1视觉-语言对齐1503亿8K仅投影交叉注意力2×10⁻⁴2大规模多模态预训练2030亿64K全模型5×10⁻⁵3高质量多模态预训练4590亿128K全模型1×10⁻⁵4退火长上下文4501亿256K全模型1×10⁻⁵SFT监督微调离线1028亿128K全模型1×10⁻⁵Realtime-SFT实时交互微调348亿256K全模型4×10⁻⁵关键策略大规模数据合成贯穿全程描述、OCR、指代定位、时间定位四类合成数据支撑感知基础所有实时特定设计集中在最后轻量阶段占总训练令牌3%Realtime-SFT仅新增两个状态令牌|silence|、|response|四、Realtime-SFT的核心机制交互范式每帧后跟决策槽位模型在三种状态中选择——\|silence\|— 继续观看不发言\|response\| 文本 — 开始/继续发言文本 \|silence\|— 发言结束数据特征56万样本约348亿令牌包含必须恰好触发一次的常驻指令答案需随场景更新的驻留问题持续实时评论5.1%样本中目标事件从不发生正确行为是全程沉默训练目标创新焦点损失 逆频率类别加权平衡沉默/发言两类发言极少见排除助手的轮次结束令牌防止模型因新用户消息而机械结束回复该技巧单独使发言频率↑39%回复长度↑68%五、离线性能表现MOSS-VL-Instruct在39个基准上对比Qwen3-VL-8B、Qwen2.5-VL-7B、LLaVA-OV-2-8B、Gemma-4-12B-IT能力域主要成果多模态感知最强板块拿下12项中5项第一MMBench 88.1POPE 89.4V* 89.0BLINK和MME-RealWorld以8.9点优势领先视频理解在时序推理集上领先——Minerva 40.5TOMATO 39.5VideoMME-Logical 17.1均超第二名4.9点指代定位Ref-Adv对抗性定位领先7.7点57.0文档/OCROmniDocBench领先4.0点88.9推理VisuLogic 27.5第一ERQA 45.8并列第一主要短板MMMU51.1远低于Qwen3-VL的69.6、文档理解、标准指代定位RefCOCO-REC——源于无思考模式、训练优化偏向实时视频而非考试式推理。六、流式性能表现MOSS-VL-Realtime在4个流式基准上对比AURA、M4、ROMA、JoyAI-VL-Interaction、VideoChat3-4B、VisPeak-7B、MMDuet系列等基准MOSS-VL得分最佳基线排名OVO-Bench70.265.3第1OmniMMI32.725.4第1ProactiveVideoQA47.242.7第1StreamingBench视觉平均69.771.1第2关键发现——主动行为子集横扫子集MOSS-VL最佳基线优势Proactive Alerting (OmniMMI)66.037.528.5点Proactive Output (StreamingBench)60.053.26.8点Forward Active Responding (OVO-Bench)62.155.86.3点Backward Tracing (OVO-Bench)72.660.412.2点结论胜利集中在“测试何时说话”的子集上这正是Realtime-SFT直接监督的行为而纯感知问答子集上AURA仍保持优势。七、推理效率与共享同一Qwen3-8B语言骨干的Qwen3-VL-8B对比隔离架构影响场景视觉上下文增长时TTFT首令牌时间优势从2.8倍扩大到5.1倍端到端延迟优势从1.9倍扩大到4.3倍同视频同分辨率MOSS-VL无时间压缩承载约2倍视觉令牌仍不落后且优势随流增长扩大效率来源视觉令牌不在解码序列中新帧仅追加到交叉注意力缓存KV缓存可增量更新。八、发布内容类别内容检查点5个Base-0708、Instruct-0708、Realtime、Base-0408、Instruct-0408训练课程完整的6阶段数据配比与超参数推理代码Transformers参考实现 SGLang集成已合入上游FlashAttention扩展cross_kv_boundary接口支持变长可见性模式现场演示实时视频分析demo条件触发、持续解说等场景九、局限与未来方向局限未来计划MMMU、文档理解等离线和基准落后于最强模型增加强化学习后训练已在公开路线图上L5层级生成时感知并修正仅有定性验证构建L5行为专用基准目前领域空白无“思考”模式后续版本考虑引入推理增强MOSS-VL的核心贡献在于“全栈协同设计”而非单一组件突破架构让视觉感知与文本生成自然并行数据教会模型响应时机何时说、何时等、何时改课程将实时能力植入一个轻量级最终阶段而非重构整个训练它是一个为“正在发生”的世界设计的模型而非为“已经结束”的视频设计的模型。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示官方项目主页地址在这里如下所示项目地址在这里如下所示预训练模型发布地址在这里如下所示摘要我们提出了 MOSS-VL一个开源的视觉-语言模型家族它将实时交互——在说话的同时进行感知——作为一等公民能力。我们通过全栈协同设计来实现这一能力语言解码器仅通过门控交叉注意力来关注视觉信息因此模型能够在生成文本的同时自然地接收传入的帧一个合成的交互语料库监督模型何时该说话、何时保持沉默以及何时修正回复一个分阶段的课程将所有的实时特定训练集中在一个轻量级的最后阶段并构建在强大的离线基础之上。在离线场景下MOSS-VL-Instruct 在相似规模模型中具有竞争力并在时间推理视频集上领先。在四个流式基准测试中MOSS-VL-Realtime 在开源流式模型中取得了三个最佳平均分在第四个上排名第二并横扫了三个直接测试主动行为的子集——在 OmniMMI 的主动警报任务上达到 66.0 分对比最佳基线的 37.5 分。尽管拥有 113 亿参数但视觉令牌位于解码序列之外随着视觉上下文的增长MOSS-VL 相对于使用相同骨干网络的 Qwen3-VL-8B 的首令牌时间优势从 2.8 倍扩大到 5.1 倍。1 引言大多数开源的视觉-语言模型以离线方式理解视频给定一个已完成的片段它们从头到尾读取它然后回答关于它的问题 [3, 4, 14]。然而视频理解最重要的应用场景并不会等待片段结束。一个实时助手观察着一个仍在展开的场景自行判断何时有值得说的事情并且必须在说话的同时继续观察。表 1 将此能力空间组织为五个层级。L1 是离线模式。L2-L4 构成了流式模式由近期的流式模型 [11, 24, 41, 47] 占据输入持续到达主动沉默和持久查询开始发挥作用但模型在每次回复期间保持“失明”。L5 增加了将实时交互与以下所有层级区分开来的能力在生成的同时进行感知因此当证据发生变化的那一刻回复可以被修正或截断。MOSS-VL 是一个开源的视觉-语言模型家族它将实时交互视为一等公民能力并通过协同设计而非任何单一组件来实现这一能力。架构赋予了这种行为语言解码器仅通过门控交叉注意力来关注视觉信息因此视觉令牌永远不会进入解码序列新到达的帧仅需追加到交叉注意力缓存中——模型在生成时自然地保持感知第 2 节。XRoPE 将文本和视觉沿一个共享时间线排序绝对时间戳令牌使挂钟时间显式化。数据注入了这种行为在离线场景下MOSS-VL-Instruct 与相似规模的开源模型具有竞争力并在时间推理视频集 Minerva、TOMATO 和 VideoMME-Logical 上领先第 6.1 节。在流式模式下胜利恰好落在测试时机的基准上在四个流式基准测试中MOSS-VL-Realtime 在三个基准上取得了最佳平均分在第四个上排名第二并横扫了三个直接测试主动行为的子集——在 OmniMMI 的主动警报任务上达到 66.0 分对比 37.5 分第 6.2 节。效率提升同样源于相同设计与基于相同 Qwen3-8B 语言骨干网络的 Qwen3-VL-8B 相比随着视觉上下文增长首令牌时间差距从 2.8 倍扩大到 5.1 倍第 6.3 节。L5 行为本身通过现场演示和发布的实时推理代码进行了定性展示第 6.4 节定量验证覆盖了 L2-L4 层级这些层级存在公共基准。图 1 结果概览。(a) 在四个流式基准测试中与开源流式基线模型的平均分对比详细信息见表 6StreamingBench 的平均分覆盖其视觉组第 6.2 节。(b) MOSS-VL 在主动流式子集上与最佳竞争模型的对比——PA主动警报OmniMMI、PO主动输出StreamingBench和 FAR前向主动响应OVO-Bench这些子集均测试模型是否在正确时机主动发言——以及在选定的离线优势上的对比详细信息见表 5 和表 6。绿色 MOSS-VL灰色 标注的竞争者。表 1 视频理解层级从离线到实时。每个层级点亮一个额外的能力轴流式模式L2-L4与实时模式L5之间的分界线在于模型是否在生成的同时保持感知——L2-L4 模型在回复期间是“失明”的而 L5 模型则不是。MOSS-VL-Realtime 实现了 L5 行为并通过现场演示和发布的实时推理代码进行了展示并在四个流式基准测试中于 L2-L4 层级进行了定量验证针对 L5 行为的专用基准测试仍然是一个悬而未决的问题。总之我们的主要贡献是为实时交互协同设计的全栈方案。架构使其成为可能——带有 XRoPE 和绝对时间戳的门控交叉注意力让模型在生成时自然地接收新帧数据注入了它——合成的流数据监督响应时机训练策略保持其稳定——语言骨干网络在零初始化的门控后保持完整。Realtime-SFT一个轻量级阶段的交互范式。两个新增状态令牌、一个共享系统提示和重新加权的下一个令牌预测损失——占总训练令牌的不到 3%——教会模型何时说话、何时保持沉默以及何时修正回复在四个流式基准测试中的三个取得最佳平均分并实现了上述主动行为任务的全面胜利。时序理解在离线场景中同样显现。未经实时语料库训练的 MOSS-VL-Instruct在我们的对比中领先于时间推理视频集——Minerva、TOMATO、VideoMME-Logical——这印证了预训练阶段奠定的感知和时序理解基础。更多参数更快服务。MOSS-VL 拥有 113 亿参数但视觉令牌保持在解码序列之外因此服务延迟随视觉上下文增长的速度慢于其使用相同骨干网络的交错式对应模型——在 SGLang 上实测而非估算。我们发布了完整的训练课程和全部五个检查点。2 架构MOSS-VL 将一个原生分辨率视觉编码器与一个从 Qwen3-8B [49] 初始化的语言解码器配对两者仅通过门控交叉注意力交互图 2。视觉令牌永远不会进入解码序列图 2 MOSS-VL 架构。图像和视频帧由 27 层视觉编码器以原生动态分辨率编码然后进行 2x2 池化并投影为视觉令牌文本同时进行令牌化。LLM 解码器48 层从 Qwen3-8B 初始化仅通过 12 个带有 tanh 门控的交叉注意力层门控交叉注意力右侧插图关注视觉令牌每四层中有一层其他 36 层自注意力层仅处理文本序列因此视觉令牌永远不会加入解码序列。交叉注意力查询携带文本位置键携带三轴 XRoPE 坐标 (t, h, w)。门控是零初始化的标量因此训练从完整的语言骨干网络开始。每个帧向文本流贡献几个时间戳令牌和一个占位符令牌而其图像块令牌则作为交叉注意力的键和值被消费。表 2 列出了配置详情。2.1 组件与参数统计视觉编码器是一个 27 层 Transformer从 Qwen3-VL 视觉编码器 [4] 初始化它以原生分辨率处理图像和帧范围从 4,096 到 16.8M 像素从三个中间层和最后一层提取特征。投影模块合并每个 2x2 的块组并将其映射到解码器的隐藏空间。解码器堆叠了 48 层从 Qwen3-8B 继承的 36 层自注意力层以及 12 个门控交叉注意力层每四层放置一个。在总共 113 亿参数中约 82 亿构成语言骨干网络23 亿构成交叉注意力堆栈8 亿构成视觉编码器和投影模块。2.2 门控交叉注意力每个交叉注意力层遵循 Flamingo [2] 的门控设计——查询来自文本隐藏状态键和值来自视觉令牌——此处使用分组查询注意力32 个查询头 / 8 个键值头和 QK-RMSNorm 实现。该层将其注意力和前馈路径包裹在 tanh 门控中这些门控的标量是零初始化的因此训练从完整的语言骨干网络开始第 3 节。36 个自注意力层从不接触视觉令牌。2.3 XRoPE据我们所知XRoPE交叉注意力旋转位置编码是首个为视觉-语言架构的交叉注意力通道引入的位置编码它赋予了这个通道原本缺乏的视觉流位置信息。XRoPE 将文本令牌和视觉块放置在一个三轴坐标空间 (t, h, w) 中按其逻辑流位置排序图 3。一个文本令牌沿所有三个轴一起前进坐标为 (x, x, x)。一个合并后块网格为 h′ x w′ 的帧在紧随前面文本的坐标 t 处锚定其块排列为p_{a,b} (t, t a, t b), 0 ≤ a h′, 0 ≤ b w′, (1)因此高度和宽度偏移量搭载在共享的时间锚点上。在视觉侧关闭该帧的分隔符令牌和文本流中该帧的占位符令牌都采用 (x, x, x)其中 x max(t h′, t w′)下一个文本令牌从 x 1 继续两个通道沿单一时间线前进。64 对旋转频率对在 (t, h, w) 上按 (24, 20, 20) 分配旋转在交叉注意力中相遇前应用于文本侧的查询和视觉侧的键。t 轴是相对序列坐标而非挂钟时间真实时间通过第 2.4 节的时间戳令牌进入。图 3 XRoPE交叉注意力通道的位置编码。文本令牌和视觉块共享一个三轴坐标空间 (t, h, w)按其逻辑流位置排序一个文本令牌沿所有三个轴一起前进而锚定在坐标 t 处的帧其块从左上角的 (t, t, t) 平铺到右下角的 (t, t h - 1, t w - 1)。在视觉侧关闭每个帧的分隔符令牌和文本流中该帧的占位符令牌接收相同的坐标因此两个通道沿单一共享时间线前进。旋转在交叉注意力中相遇前应用于文本侧的查询和视觉侧的键。2.4 绝对时间戳位置信息本身并不能说明挂钟时间且帧率各异MOSS-VL 以 1-16 fps 采样视频采用运动自适应方式表 2。因此每个帧在文本流中之前都有一个绝对时间戳 |time_start|X.X seconds|time_end|以便模型直接从令牌中读取真实时间而不是从位置推断从而在任何采样率下时间都保持显式。2.5 实时性源于设计当新帧到达时仅对该帧进行编码其键和值被追加到交叉注意力缓存中之前的帧既不会被重新编码其键和值也不会被重新计算。解码序列仅增加该帧的时间戳令牌和一个占位符令牌——图像块令牌保持在视觉侧——因此新到达的流不会破坏解码状态下一个生成的令牌已经通过门控层关注到更新后的缓存。第 6 节量化了这在推理时带来的效率图 4。2.6 发布模型我们发布了同一架构的五个检查点表 3。0708 运行——MOSS-VL-Base、MOSS-VL-Instruct、MOSS-VL-Realtime——是本报告的主题0408 对是同一架构的早期独立训练运行为研究连续性而发布。表 2 MOSS-VL 配置所有发布检查点相同。视频输入范围反映了原生训练设置发布的处理器默认为 1 fps 和 256 帧我们的评估保持 1 fps并将上限提高到 768 帧第 6 节。3 预训练MOSS-VL 采用四个阶段进行预训练视觉-语言对齐、大规模多模态预训练、高质量多模态预训练以及最后的退火和长上下文训练阶段。表 4 列出了每个阶段的令牌预算、样本数量、最大序列长度、可训练模块和峰值学习率包括第 4 节中的两个后训练阶段。该表展示了课程的形状最大序列长度从 8K 增长到 256K 个令牌且令牌预算向后阶段倾斜同时样本数量下降了数个数量级——早期是大量短样本后期是数量少得多但更长、更密集的样本。整个过程中数据已针对我们的评估套件进行去污处理。此次训练运行的一个决定性特征是我们数据合成的规模。除了从现有语料库收集和重组的数据外我们在整个课程中大规模合成了高质量的描述、OCR、指代定位和时间定位数据。这四种类型涵盖了视觉-语言模型的感知基础——描述场景、读取嵌入文本、定位对象和在时间上锚定事件——这一合成核心支撑了发布模型强大的感知和时序理解基础。3.1 阶段 1视觉-语言对齐阶段 1 连接两个预训练组件。仅更新新引入的参数——投影模块和交叉注意力层——而视觉编码器和语言模型保持冻结表 4 中的高峰值学习率仅适用于这些新模块。数据包括两类图像描述和 OCR序列保持在 8K 个令牌的短长度。表 3 发布的 MOSS-VL 检查点。0708 运行是本报告的主题MOSS-VL-Base 是预训练模型MOSS-VL-Instruct 是其指令微调后继版本MOSS-VL-Realtime 则从 MOSS-VL-Instruct 开始使用 Realtime-SFT 继续训练。0408 检查点是同一架构的早期独立训练运行为研究连续性而一同发布。全部五个均可在 HuggingFace 上的 OpenMOSS-Team 组织下获取。3.2 阶段 2大规模多模态预训练连接器对齐后阶段 2 解冻整个模型并提供广度。数据混合包括图像和视频描述、OCR、指代定位、交错图像-文本文档和纯文本预训练语料库以及涵盖单图像、多图像集、视频和纯文本跨不同领域的多模态理解数据还有推理数据。上下文窗口扩展到 64K 个令牌以容纳长交错文档和视频。3.3 阶段 3高质量多模态预训练阶段 3 投入了课程中最大的令牌预算表 4用于其最高质量的数据。混合保持了阶段 2 的类别但重新平衡描述减少多模态理解和推理数据占比增大并引入了数学、知识密集型数据和时间定位数据。序列扩展到 128K 个令牌。3.4 阶段 4退火与长上下文训练最后阶段结合了长上下文训练和高质量退火。一个数据分支由长视频描述、长视频问答和长视频时间定位以及长文档和长文本数据组成并与少量常规类别数据混合将序列扩展到 256K 个令牌。另一个是退火混合重新加权偏向数学、知识密集型数据和指令调优及问答数据并包含身份数据。此课程产出 MOSS-VL-Base这是后训练的起点第 4 节。4 后训练后训练分为两个有监督阶段表 4两者均不使用强化学习或“思考”模式。标准的监督微调SFT将 MOSS-VL-Base 转变为 MOSS-VL-Instruct一个离线指令跟随者。Realtime-SFT 则从 MOSS-VL-Instruct表 3继续并植入实时交互范式在每一帧决定是否说话在无需发言时保持沉默并在场景推翻先前的答案时进行修正。MOSS-VL 中每个实时特定的设计选择都存在于这最后一个阶段该阶段占总训练令牌的不到 3%。4.1 监督微调我们在 760 万个指令样本1028 亿个令牌上使用标准的助手回复下一个令牌交叉熵损失对 MOSS-VL-Base 进行微调序列长度可达 128K 个令牌表 4。样本结合了从现有语料库收集和重组的数据以及内部合成的数据所有数据在进入混合之前都经过过滤、去重、针对评估套件的去污处理和质量筛选。混合覆盖了基于单图像、多图像集、视频和纯文本的通用问答感知中心任务包括 OCR、文档理解以及空间和时间定位图像和视频描述以及推理中心任务涵盖多模态推理、数学和其他学科、代码和知识密集型问答以及身份数据。4.2 Realtime-SFT学习何时说话Realtime-SFT 教会模型将传入的视频视为一系列决策而非一个已完成的成品。训练样本按到达顺序交错文本和帧每个帧后跟一个决策槽位每个槽位采用三种形式之一——|silence|继续观看、|response| 后跟文本现在说话或一个以 |silence| 结尾的回复结束发言。一个回复按帧逐帧分布在连续的槽位上模拟速率受限的实时输出并且单个用户轮次可能包含若干次独立的发言。实现这一功能仅需增加两个新的词表条目——两个状态令牌从语义相关的现有令牌嵌入初始化。发言或等待的决策本身是普通的下一令牌预测每当最可能的下一令牌是 |silence| 时模型等待下一帧否则它解码一个回复。没有附加专用的决策头。数据特征。Realtime-SFT 语料库56 万个样本约 3480 亿个令牌表 4的独特之处在于每个样本都将模型置于一个明确的交互角色而非普通的问答角色必须在其条件满足时恰好触发一次的常驻指令答案必须随证据积累而更新的驻留问题持续的实时评论跨流累积的计数判断当前是否是说话时机的探针以及保持身份一致性的独立于视频的对话。此外一部分离线问答和通用多模态数据用于保持离线能力。数据构建。语料库有两个来源。我们首先收集用于流式视频理解的开源数据集并对其进行严格过滤和重新标注。然而更重要的是我们自行合成的数据针对现有数据集很少或根本不提供的行为保持沉默直到证据出现随着场景演变修正答案以及当新事件中途打断回复时进行恢复。合成遵循 MOSS-Video-Preview [39] 中引入的描述驱动流程分层的、时间密集锚定的描述被挖掘用于目标对象的状态转换每个转换产生一个问题、一个立即可回答的回复和一个更新轨迹回复被锚定到视觉时刻在帧间布局其间穿插沉默并进行质量过滤。本轮升级了该流程四个阶段中的三个。时间锚定现在逐帧对照实际镜头进行验证每个回复被分配其证据变得可见的时刻和其停止有效的时刻。交接更自然被新事件推翻的回复被重写为平实的语言自我修正而非用专用的中断令牌标记。最后质量门检查每个样本与其帧的对应关系仅保留那些回复在发出时基于可见内容的样本。语料库统计。交互优先的侧重点在数据中显而易见。在整个语料库中模型被监督了 220 万次发言决策其中 58.7% 是自定时的而非由新的用户问题提示在 5.1% 的样本中目标事件从未发生正确的行为是全程保持沉默。流以 1 fps 运行每个窗口最多 768 帧约 12.8 分钟。语料库已针对评估套件进行去污处理基准视频通过预留列表排除。4.3 模式控制与训练目标MOSS-VL 中的模式控制仅需一条系统提示。流式和实时模式共享一条提示——实时操作是流式的特例——而离线推理不使用任何提示。因此一套权重可在三种推理模式下运行架构零更改。提示重现如下完整的对话模板包括帧和时间戳的交错方式在附录 A.1 中给出。共享的流式/实时系统提示你是一名擅长实时视频分析的人工智能助手。视频逐帧流式传输给你。在每一帧你都独立决定是回复还是保持沉默——当没有相关事件发生时输出 |silence|当视觉内容值得回复时进行回复。监督仅覆盖助手的可控部分回复文本和两个状态令牌。系统和用户轮次以及扩展的视觉令牌被排除在损失之外。核心困难在于不平衡沉默槽位远超发言决策在统一权重下模型只会学习保持沉默。因此我们使用焦点因子和逆频率类别系数对两个状态令牌进行重新加权并在每一步计算全局批次上的类别统计这使得类别系数在数据并行的各个 ranks 上保持一致还有一个掩码选择在流式场景中尤为重要。在离线聊天中关闭助手轮次的令牌标志着交流结束在流式中轮次边界通常意味着用户插话而世界——以及对话——仍在继续。因此我们也从监督中排除助手的轮次结束令牌使模型永远不会仅仅因为新的用户轮次出现而学习结束回复。在一个受控的单变量对比中此掩码将发言频率提高了 39%平均回复长度提高了 68%。这里植入的行为在第 6 节中通过四个流式基准进行了定量评估并在图 5 中进行了定性展示。5 基础设施MOSS-VL 在 Megatron-LM 堆栈 [35] 上训练该堆栈结合了数据、张量、序列和上下文并行性以承载从 8K 到 256K 令牌序列的课程表 4。变长多模态样本被打包成完整序列使批次在混合的图像、视频和文本数据中保持密集。用于交叉注意力的 FlashAttention。第 2.2 节中的门控交叉注意力具有一种可见性模式现成的注意力内核无法满足每个文本查询关注流中其之前每个帧的视觉令牌第 2.5 节。因此可见性是键值序列的每个查询前缀逐帧增长。图 4 MOSS-VL 与 Qwen3-VL-8B 的实测服务延迟对比——两者使用相同的 Qwen3-8B 语言骨干网络隔离了视觉集成架构。两个模型均使用 SGLang 在单张 H200TP1BF16相同引擎版本上进行离线服务并设置了相同的生成长度上限所有运行均达到该上限每个点是五次独立冷启动的平均值误差线样本标准差。(a, c) 在 ViT 输出匹配的情况下首令牌时间TTFT差距随视觉上下文增长从 2.8 倍扩大到 5.1 倍端到端延迟从 1.9 倍扩大到 4.3 倍。(b, d) 在相同视频、相同分辨率和帧数下Qwen3-VL 在时间轴上压缩 2 倍而 MOSS-VL 放弃时间压缩以便每帧到达时立即编码——在相同输入上承载约两倍的视觉令牌——但它的速度从未落后且其领先优势随流长度增长而扩大。延迟增长更慢源于仅追加的交叉注意力设计视觉令牌从不进入解码序列第 2 节。FlashAttention 暴露了因果或窗口掩码而将该模式实现为密集交叉注意力掩码则会消耗与文本和视觉序列长度乘积成正比的存储和带宽。因此我们将 FlashAttention-3 [33] 扩展了一个紧凑接口 cross_kv_boundary它将每个查询行的可见前缀编码为一个 32 位整数并通过算子模式、调度器和 CUDA 前向及反向内核传递。超过行边界的键值块被裁剪掉而非计算和掩码因此内核成本与可见性成比例。后端覆盖了密集、变长和 KV 缓存执行路径——这使其与打包训练兼容——并作为上游实现的衍生版本随模型一起发布。服务与发布。我们对 MOSS-VL 的 SGLang [56] 集成已合并到上游第 6 节图 4中的离线服务测量在此堆栈上运行。实时交互作为 Transformers 参考实现单独提供与模型权重一起在 GitHub 和 HuggingFace 上发布。6 评估我们根据每个模型的构建目标进行评估MOSS-VL-Instruct 在涵盖五个能力域的 39 个离线基准套件上进行评估表 5而 MOSS-VL-Realtime 在四个流式基准——OVO-Bench [20]、OmniMMI [44]、StreamingBench [21] 和 ProactiveVideoQA [43]——上进行评估这些基准共同覆盖了表 1 中能力层级的 L2-L4。表 5 离线结果MOSS-VL-Instruct0708 版本与相似规模的开源模型对比按能力域分组。粗体 最佳下划线 次佳- 未报告LLaVA-OV-2 LLaVA-OneVision-2-8B。评估协议和基线来源详见第 6.1 节。6.1 离线结果表 5 将 MOSS-VL-Instruct 与相似规模的开源模型——Qwen3-VL-8B [4]、Qwen2.5-VL-7B [5]、LLaVA-OneVision-2-8B [3] 和 Gemma-4-12B-IT [14]——在多种模态感知、视频理解、指代定位、文档/OCR 和推理方面进行了比较。MOSS-VL 结果以 1 fps 采样视频最多 768 帧遵循基准的官方协议如有规定DocVQA 和 InfoVQA 使用验证集。基线数据取自各自的官方报告反映了作者们的推理设置可能与我们的不同特别是在视频帧数方面。例外情况是 Gemma-4-12B-IT 列我们自己在与 MOSS-VL 相同的协议下进行了评估以及 Qwen3-VL 在 OmniDocBench (v1.6) 上的条目使用官方 Qwen3-VL 食谱中的 Markdown 提示进行评估其余 OmniDocBench 基线被省略因为它们的官方数据在指标上不可比。感知是最强的板块MOSS-VL-Instruct 在十二行中取得了五个最佳——MMBench-EN (88.1)、POPE (89.4)、V* (89.0)以及 MME-RealWorld (66.3) 和 BLINK (78.0)后者领先 8.9 个百分点。在视频方面它领先于时间推理集——Minerva (40.5)、TOMATO (39.5) 和 VideoMME-Logical (17.1)每个至少领先 4.9 分——以及 EgoSchema (67.0)这与第 3 节中构建的感知和时间理解基础一致。优势还延伸到其他领域对抗性的 Ref-Adv 指代定位集由 MOSS-VL-Instruct 以 7.7 个百分点领先 (57.0)文档解析 OmniDocBench 领先 4.0 分 (88.9)推理方面它拿下了 VisuLogic (27.5) 并共享了最高的 ERQA 分数 (45.8)。主要差距在于 MMMU、文档理解和标准指代定位RefCOCO-REC以及时间定位TimeLens前两个我们将在第 7 节中讨论。6.2 流式基准测试表 6 报告了四个流式基准测试的子集级别结果。基线是开源流式模型——AURA [24]、M4随 OmniMMI 一同发布[44]、ROMA [36]、JoyAI-VL-Interaction [51]、VideoChat3-4B [18]、VisPeak-7B [11] 和 MMDuet 系列 [41-43]该面板遵循每个基准的已发布覆盖范围因此在四个基准中有所不同。基线数据取自各自的官方报告但 MMDuet 在 OmniMMI 上的条目除外其自身报告未覆盖取自 ROMA 报告MOSS-VL-Realtime 数据来自我们在每个基准官方协议下的评估。MOSS-VL-Realtime 运行一个 82 亿参数的语言骨干网络与 7-8B 级别的基线相当其额外参数位于解码序列之外即视觉编码器和交叉注意力堆栈中第 2 节。每个基准都在子集级别报告。OVO-Bench 区分前向主动响应FAR、后向追踪BT和实时视觉感知RTVP。OmniMMI 覆盖主动警报PA、动态状态定位SG、多轮依赖MD、动作预测AP和说话人识别SI其 Avg 是五个子集的平均值仅对报告了全部五个子集的模型显示。StreamingBench 分组为实时视觉理解RT和上下文理解CTX其中主动输出PO和顺序问答SQA作为 CTX 的子集为主动性分析单独列出Avg视觉是 RT 和 CTX 组得分的平均值——MOSS-VL 不接受音频输入因此不评估依赖音频的 Omni-Source 组也不报告官方总体得分。ProactiveVideoQA 按视频来源分为网络WEB、自我中心EGO和电视剧TV视频问答以及视频异常检测VAD。MOSS-VL-Realtime 在四个基准中的三个上取得了最佳平均分——OVO-Bench (70.2 vs. 次佳 65.3)、OmniMMI (32.7 vs. 25.4) 和 ProactiveVideoQA (47.2 vs. 42.7)——并在 StreamingBench 的视觉平均分上排名第二 (69.7 vs. AURA 的 71.1)。子集模式比平均值更能说明问题。三个直接测试主动行为——在正确时机主动发言——的子集全部由 MOSS-VL-Realtime 拿下OmniMMI 上的主动警报 (66.0 vs. 37.5)、StreamingBench 上的主动输出 (60.0 vs. 53.2) 和 OVO-Bench 上的前向主动响应 (62.1 vs. 55.8)。ProactiveVideoQA 的每个子集都是主动的总体上跟随此趋势而 OVO-Bench 上的后向追踪 (72.6 vs. 60.4) 表明累积的流历史仍然可用。这些胜利集中在响应时间是被测试技能的地方——这正是 Realtime-SFT 直接监督的行为第 4.2 节当子集简化为对当前场景的感知问答时AURA 保持领先。表 6 流式基准测试结果MOSS-VL-Realtime 与开源流式基线模型在子集级别的对比。粗体 最佳下划线 次佳- 该模型官方报告中未报告该子集。子集缩写、每个基准的 Avg 约定和数据来源详见第 6.2 节。6.3 推理效率图 4 测量了与 Qwen3-VL-8B 的服务延迟对比后者共享 Qwen3-8B 语言骨干网络 [49]因此比较隔离了视觉集成架构。两个模型都在单张 H200 上运行离线 SGLang 服务第 5 节。在 ViT 输出匹配的情况下首令牌时间差距随视觉上下文增长从 2.8 倍扩大到 5.1 倍端到端延迟从 1.9 倍扩大到 4.3 倍。同一视频的比较对我们更严格MOSS-VL 放弃时间压缩以便每帧到达时立即编码第 2.5 节因此在相同输入上承载约 Qwen3-VL 两倍的视觉令牌——但在所有测量点上它都从未落后。优势随视觉上下文增长而扩大这正是实时助手所处的模式视觉历史按分钟累积而回复必须按时到达。6.4 定性结果图5展示了已植入的行为在实时运行中的表现截取自发布版演示的两个会话。在常驻条件指令下模型在整个视频流中保持沉默并在四次目标接触时恰好触发且仅在这四个时刻触发在单条解说指令下模型在一秒内开始输出并跟踪一个任意球序列——从哨声、射门、庆祝到比分更新——贯穿整个过程。这两个会话在真实世界的时序条件下分别践行了Realtime-SFT语料库第4.2节中的核心交互角色——一个必须在其条件满足时恰好触发一次的常驻指令以及持续的实时解说。7 讨论总体来看评估显示了一种模式而非单一分数。流式方面的胜利集中在测试“何时说话”的子集服务优势恰好随视觉历史累积而扩大离线优势则集中在时间推理视频集上。没有任何单一组件能解释这种形态。这正是从外部看到的协同设计的样子一个让感知与生成自然并行的架构一个监督响应时机的语料库以及一个在构建基础后通过一个轻量级最终阶段使其具备交互性的课程。我们将整个系统而不仅仅是权重视为发布内容随五个检查点一同发布的是分阶段训练课程表 4、完整的 Realtime-SFT 对话模板附录 A.1、实时推理实现、扩展的 FlashAttention-3 后端第 5 节以及第 6.4 节中录制的现场会话。局限性同样明显。MOSS-VL-Instruct 在 MMMU 等重推理套件和以文档为中心的基准上落后于同规模的最强开源模型表 5MOSS-VL 未配备“思考”模式其训练针对实时视频而非应试式推理进行了优化。本报告围绕的核心能力在其最高层级上仍是通过定性方式证明的定量验证止于 L2-L4因为公开的流式基准止步于此尚无现有基准衡量生成过程中的感知——即模型是否在场景逆转的瞬间修正或截断自己的回复。这两个局限性标志着近期议程针对 MOSS-VL 系列的强化学习后训练已在我们的公开路线图上以及一个针对 L5 行为的专用基准该领域目前仍缺乏。8 结论MOSS-VL 使实时交互成为开源视觉-语言模型家族的一等公民能力。它是内建的而非外挂的带有 XRoPE 的门控交叉注意力允许在生成文本时接收帧合成的交互数据教会模型何时说话、何时等待以及何时修正分阶段课程将所有实时特定选择限制在一个轻量级最终阶段。在评估中MOSS-VL-Instruct 在离线场景表现强劲尤其是在时间推理任务上MOSS-VL-Realtime 在测试响应时机的流式基准上领先服务延迟随视觉上下文增长的速度慢于交错式同行。权重、课程和代码均已开源。
返回列表