
MAVIN 这个项目让我重新思考了一个问题AI 生成视频到底是在生成画面还是在生成故事过去一年里文本生成视频已经不难见到输入一句提示词几十秒后你就能拿到一个动态镜头。但绝大部分输出的问题都一样它只有一个镜头没有镜头切换没有叙事节奏更谈不上人物在这个镜头里说完话下一个镜头还在同一个房间里接着推进剧情。MAVIN 出现在 ECCV 2026 Oral 名单里标题信息很直接“从一句提示词到多镜头成片”。如果要给这个系统下一句判断我会说MAVIN 做的事情不是把单镜头提示词包装得更好看而是把“一句话”拆成“可执行的剧本”再让视频模型按剧本分镜去生成。这是从“生成画面”到“按剧本讲故事”的一次工作流升级。1. 先搞清楚单镜头提示词为什么讲不了故事1.1 单镜头生成只能证明“模型会画画”不能证明“模型会叙事”我们日常使用的文生视频模型本质上是一个“视觉世界模拟器”你给它一段文本它生成一段视觉内容。它能处理“一个宇航员在火星上跑步”这样的单镜头描述因为画面里的人物、动作、背景可以在几秒内保持一致。但“讲故事”至少需要两个以上事件在时间上发生因果关联需要一个角色在多个镜头中持续存在需要观众的注意力被引导到关键信息上。这些要求超出单镜头生成范畴。一个很常见的现象是输入“一个女孩在咖啡馆里写信然后她望向窗外雨开始下”很多模型会在第一个镜头里把女孩生成成一个样子第二个镜头里就换了发型或者咖啡馆内部布局跟着变。单镜头生成时模型只需要维护一个短片段内的视觉一致性多镜头时模型必须跨片段维护同一个角色、同一个场景、同一条时间线。这不是单纯的“多生成几个片段再拼起来”。1.2 多镜头生成真正的难题不是“数量多”而是“关系一致”多镜头成片的问题不在于工作量增加而在于系统必须建立一个“跨镜头状态”。什么叫跨镜头状态简单说就是第一个镜头里出现的人和物第二个镜头里还是同一个且它们之间的空间关系、服装、光线、情绪状态都要能够延续。这里有个很容易被忽略的点人类观看视频时会自动建立“镜头之间的逻辑关系”。AI 生成的多镜头如果只是把几个漂亮的单镜头剪辑在一起每个镜头单独看都很精彩连起来观众会觉得“这不是一个故事”。原因在于镜头之间存在隐式的连续性要求角色身份、场景语义、动作承接、对话轮次、镜头景别变化。要让 AI 理解这些模型需要的不只是视觉生成能力还需要一个“叙事中间表示”。1.3 把提示词当剧本本身就是错误的输入设计我们常说“一句提示词生成视频”但一句提示词通常只适合表达“一个镜头”。如果是“剧本”它应该包含角色、地点、事件、先后顺序、镜头情绪、关键对白。比如“深夜女孩在咖啡馆写最后一封信写完后把信折起来抬头望向窗外雨夜”这听起来像一句话但实际包含至少四个可拆分的镜头走进、坐下、写信、折信、望窗外。如果模型不做拆分只把它压缩成一个镜头画面会变得拥挤叙事也被压缩了。这也是 MAVIN 这类系统值得关注的原因。它不是先“理解一句完整的话”而是先判断这句话里有哪些可执行的叙事单元再决定每个单元对应什么镜头。这等于把提示词从“画面描述”升级成“剧本描述”。2. MAVIN 的核心思路从“生成视频”到“生成分镜计划”2.1 一条可能的技术链路理解、拆分、生成、拼合从标题的信息来看MAVIN 的工作链路大概率可以拆成四个阶段理解输入、拆分剧本、生成镜头、拼合成片。第一阶段系统需要把自然语言提示词转换成一个结构化的叙事草案第二阶段把草案切分成镜头粒度第三阶段每个镜头调用生成模型第四阶段把镜头按顺序拼接并尽量消除跨镜头的视觉突变。这个链路里最关键的并不是第三阶段的“生成”而是第二阶段的“拆分”。如果拆分得不好后面生成再好的画面也拼不出一个有节奏的故事。你可以把它类比成拍短片编剧先写剧本导演再画分镜摄影师按分镜拍摄剪辑师拼接。MAVIN 的价值是把这个工作流中的“导演/编剧”角色用模型自动化了。2.2 为什么中间需要一层“剧本表示”如果直接把一句提示词传给视频生成模型模型只能看到一个文本序列它缺少“这个故事可以分为几场戏”的显式信息。中间增加一层结构化的剧本表示能让模型在生成每个镜头时获得全局上下文谁是主角、当前在哪里、上一镜发生了什么、这一镜的情绪基调是什么。常见做法是生成一个镜次表或分镜脚本类似{ story: 一个女孩在咖啡馆写下最后一封信然后望向窗外的雨。, characters: [ {id: girl, name: 女孩, appearance: 棕色长发米色毛衣} ], shots: [ {shot: 1, scene: 咖啡馆, type: 全景, action: 女孩推门走进来, camera: 固定}, {shot: 2, scene: 咖啡馆, type: 中景, action: 女孩坐下拿出信纸, camera: 推进}, {shot: 3, scene: 咖啡馆, type: 特写, action: 写最后一个字, camera: 特写}, {shot: 4, scene: 咖啡馆窗边, type: 中景, action: 折叠信纸抬头望向窗外, camera: 移镜} ] }这是一个通用示例结构不是 MAVIN 官方格式。但它的作用是告诉你剧本表示让“人物、地点、时间”成为了可以跨镜头控制的变量。模型在生成镜头三时能知道镜头一里的人物长什么样生成镜头四时能知道窗外正在下雨。2.3 这意味着什么叙事结构成为可调参数过去我们调整视频生成结果只能调整提示词里的形容词多镜头结构出现后我们还可以调整“分镜顺序”“镜头时长”“镜头景别”“节奏”。比如同样的故事你可以把特写放在前面强化情绪也可以把全景放在前面交代空间。叙事结构的自由度让 AI 生成从“抽卡”变成了“导演”。当然自由度增加也意味着参数面变宽用户要关心的不再只是一句提示词而是剧本结构、分镜表、镜头间一致性。这会把 AI 视频生成带入一个更接近专业创作的工作流但也对使用者提出了更高要求。3. 用一套通用流程跑通“一句提示词到多镜头成片”3.1 第一步把提示词扩展成结构化剧本MAVIN 或类似系统在最开始都会接收一个“叙事性提示词”。如果你只输入“一只猫在窗台上看雨”系统可能会把它当作一个单镜头场景如果你希望它变成多镜头成片你需要让系统意识到这里存在多个镜头。一个更高质量的做法是主动提供结构比如“一只猫从床上跳上窗台看着窗外的人群雨水从玻璃滑落”。从实际操作看输入时可以先做一次“剧本扩展”把一段话拆成“角色”“场景”“事件序列”“情绪线”。即使系统本身支持自动拆分用户提前把关键事件标明也能减少分镜错误。建议用最朴素的列表或短句而不是写成完整小说。3.2 第二步把剧本拆成分镜表这一步通常由系统自动完成但用户需要检查分镜表。检查重点有三个角色是否在每个镜头中被指定场景切换是否有交代镜头之间的动作是否连贯。比如“女孩写信”和“女孩望向窗外”之间如果缺少“放下笔”的动作拼合时会显得跳。建议在一开始时不要追求复杂调度。只做“全景—中景—特写”这样的基础景别切换镜头数量控制在 4 到 8 个之间。这能最大程度减少因分镜过多导致的一致性失效。等到流程稳定再尝试运镜、对照和场景切换。3.3 第三步逐个生成镜头再按分镜表拼合理想情况下系统会统一生成所有镜头并在生成时共享全局上下文。但如果你使用的是非统一式流程更稳妥的做法是先逐镜头生成用第一个镜头的关键帧或角色描述作为后续镜头的控制条件最后再拼接。拼接时要注意每个镜头的时长、调速、转场。很多工具会直接输出 mp4但有一个容易被忽略的问题转场效果如果由剪辑软件自动加会覆盖掉模型生成的视觉连续性导致观感混乱。建议优先使用硬切遇到生成片段有明显光照差异时再考虑用叠化过渡。3.4 一个最小验证的建议不要一上来生成一个 2 分钟短片。先拿“一个场景、一个角色、三个动作”做最小验证。比如“女孩在书桌前写信折好信纸放进抽屉”。等这个三镜头片段在角色一致性、动作连续性、场景稳定性上都没问题再扩张到多场景多角色。这个策略能很快定位问题如果三个镜头都通不过问题大概率不在拼接而在输入或者剧本拆分。注意不要急着把提示词写得很长。先让剧本结构正确再考虑文采。4. 真正决定成片质量的是一致性与可控性4.1 人物一致性、场景一致性、时间线一致性多镜头视频最怕的不是画质低而是“每个镜头都好看但放在一起不像一个人”。人物一致性要求同一个角色在不同镜头中保持外貌、服装、姿态状态的稳定场景一致性要求同一个地点在不同机位下保持布局、光线、道具的统一时间线一致性要求动作顺序和因果关系不出错。这三类一致性其实对应着不同的控制机制。人物一致通常会用到角色 embedding 或参考图场景一致会用到场景级表示时间线一致性则依赖于分镜表顺序。如果你在拼接后看到角色“换脸”优先检查角色描述是否在分镜表里保持完全相同而不是先去调生成模型的随机种子。4.2 可控性镜头语言与运动轨迹的输入方式多镜头成片要“像人导的”还需要控制镜头语言。常见的控制维度包括景别全景/中景/特写、运镜固定/推进/平移、镜头时长3 秒/5 秒/8 秒、情绪基调温暖/压抑/疏离。这些信息应该出现在分镜表里而不是只出现在自然语言提示词里。越结构化系统越容易遵循。如果 MAVIN 支持更细粒度的控制它可能还会接受 camera path、motion trajectory 这类信号。但需要注意控制信号越细对生成模型的约束越强生成的画面自由度也会降低。比较好的做法是抓住“关键镜头”使用强控制其余镜头给模型更多随机性保留一点“意外惊喜”。4.3 用一张表看质量风险点风险点表现常见原因排查方向角色漂移同一角色的脸或服装在镜头间变化角色描述不统一没有参考图检查分镜表中的角色字段场景跳变同一个场景的布局在镜头间不一致场景描述太粗镜头间缺关键信息增加场景级描述或参考图动作断裂上一个镜头还在“写”下一个镜头已经“发呆”动作序列拆解遗漏补全动作中间帧事件节奏失衡每个镜头时长接近叙事平淡分镜表没有设计情绪强弱用镜头时长和景别拉开节奏拼接闪烁相邻镜头亮度或色调跳变单镜头生成各自独立统一光照描述或用转场弱化这张表不适合当成最终答案但它是一个很实用的自检表。尤其是前面四个风险基本都出在输入和中间表示层而不是生成模型本身。5. 落地时最容易踩的坑和排查链路5.1 五个高频异常以及它们通常发生在哪一层第一条生成出来的视频只有单镜头。这多半是输入提示词被系统识别成了单个镜头可能因为描述太“画面化”没有事件序列。第二条多镜头生成后角色长相完全不同。这是跨镜头一致性控制失效重点看角色描述是否在每个镜头中都存在。第三条镜头拼接后人物动作出现“倒放”式跳变。这是分镜表里的动作顺序不严谨。第四条视频整体看起来像 PPT没有运动感。这通常是因为每个镜头太短或运镜信号缺失。第五条故事没有结局最后一个镜头像是被截断。这是剧本扩展时缺少结尾事件。通过这五条基本可以确定多镜头成片质量不是“最后拼接那时决定的”而是从输入提示词那一刻就开始累积了。5.2 推荐排查顺序输入 - 剧本解析 - 分镜 - 单镜头 - 拼接遇到问题时建议不要一头扎进生成模型参数里调随机种子。先按这种链路排查先看输入。提示词是否包含足够的事件序列是否包含角色、地点、时间再看剧本解析输出。系统有没有把提示词拆成正确的叙事单元有没有漏掉核心事件再看分镜表。每个镜头是否都有景别、动作、角色、场景镜头数量是否合理再看单镜头生成。单独看某个镜头内部有没有明显的物理错误或文字错误。最后看拼接。镜头之间光照、色调、转场是否统一。这里的关键是“先确认输入和中间表示没问题再去怀疑生成模型”。因为大部分多镜头失败案例问题都出在前三层。5.3 先跑通一条台词再跑完整短片另一个实用策略是先只生成“一个角色说一句话”的短片段比如“女孩站在门口说你好”。这个片段包含的关键不是视觉复杂度而是“说话动作”和“声音/字幕”是否与画面匹配。跑通之后再扩展到“女孩走进门、坐下、说你好、对方回应”。每扩展一步都是在一层层增加叙事复杂度。如果你在第一步就遇到角色口型错误、字幕不匹配、镜头里人物动作僵硬就不要急着做多镜头了。先解决这个最小单元否则后面的错误会成倍叠加。注意多镜头成片的调试成本会随镜头数量指数上升。保持镜头数量少是控制调试成本最重要的手段。6. 哪些场景该用哪些场景不该用6.1 适合预演、分镜验证、创意探索、教学内容MAVIN 这类系统最合适的场景不是“交付成片”而是“验证想法”。比如广告导演在拍片前想快速看到一个分镜预演帮助客户确定视觉方向短视频创作者想在几分钟内产出不同版本的剧情走向新媒体编辑想把一篇文案快速变成一个叙事短片用于内部讨论。这些场景的共同特点是对画面细节不要求完美对叙事逻辑和节奏要求较高。这类系统也是很好的教学工具。在影视创作、故事板设计、AI 叙事研究中学生可以用它快速生成一个“可看的分镜稿”从而更早进入剪辑和叙事分析。它不一定能替代人工画分镜但能降低从文字到可视化的门槛。6.2 不适合成品级商业交付、依赖精确台词的场景、复杂物理交互如果客户要求画面必须达到电影级、演员表情必须完全符合剧本、产品细节必须分毫不差那么当前这类多镜头生成系统还不适合直接交付。它不是“生成最终画面”的工具更像是“生成可视剧本”的工具。依赖精确台词或品牌信息的场景也需要谨慎因为大模型生成的文字和语音仍然会出现识别错误一条广告里口播出错返工成本很高。复杂物理交互也是重灾区。液体、火焰、碰撞、人物之间精确的动作接触这些内容在单镜头里都难稳定生成放到多镜头里更容易产生穿帮。同样多角色对话场景也不是最优先尝试的目标因为跨镜头保持多个角色关系的一致性难度会成倍上升。6.3 长期使用还需要补上的工程能力如果你打算把这类系统接入日常内容生产线至少需要补齐四块工程能力素材管理每个镜头生成的视频要有关键帧、角色描述、分镜表等元数据方便后期检索。失败重试策略批量生成多镜头时某个镜头失败不应中断整体任务需要支持重跑单个镜头。一致性模板沉淀把常用角色、场景描述保存成模板下次生成时直接复用减少输入不一致。人工审核节点在每个镜头进入拼接前设置一个检查步骤拦截明显穿帮而不是等成片出来再返工。这些能力不是 MAVIN 本身需要考虑的而是使用者需要建立的流程。工具再好如果没有流程多镜头成片只会变成多个单镜头的堆叠。回到开头那个判断AI 生成视频到底是在生成画面还是在生成故事MAVIN 给出了一个方向它把提示词变成了剧本把单镜头生成变成了分镜计划。对我来说这类系统最有价值的地方不是“一句提示词就能出片”的便利而是它逼着使用者去思考镜头、节奏、角色和叙事之间的关系。如果你也想尝试我的建议是不要从复杂故事开始。先找一个只有三个镜头的短片段把输入提示词、剧本拆分、镜头生成、拼接验证完整跑一遍。跑通之后你手里掌握的不只是一个工具而是一套可以复用的“AI 导演”工作流。