
接触 MiniMax H3 之后我一度以为提示词写作还是老一套把角色、场景、动作、氛围尽量描述清楚剩下的交给模型发挥。但连续生成的几段视频里人物要么像踩着滑板一样在地上飘要么一个转身就多出一只手臂提示词写了一大段画面却没有细节的支配感。后来我才意识到H3 这类视频生成模型的提示词和对话模型、图像模型的提示词已经不是同一个物种。写 H3 提示词看起来是在写一段话实际上是在定义一场有起幅、有落幅、有调度、有物理约束的表演。优秀的提示词不是句子华丽而是把时间、空间、运动、镜头这四个维度说清楚。这篇文章我会从社区里反复出现的优秀案例出发拆出七类可复用的写法再给出一套六层提示词框架最后聊一聊官方 Skill 模板、导演台和本地部署场景下最容易翻车的排查顺序。1. 先搞清楚MiniMax H3 提示词到底在解决什么问题很多人在 H3 上写提示词的第一反应是把过去积累的对话模型经验搬过来。需求说清楚剩下让模型自己补。这个思路在文本模型里成立在视频生成模型里会很快碰壁。视频生成模型面对的不是“理解你的意思”而是“在约束条件下采样一段视觉序列”。提示词是压缩这个采样空间的关键工具。你给的约束越接近真实画面调度模型就越少靠默认习惯去猜。反过来如果你只写“一个女孩在街上走”模型只能从训练数据里挑一个最常见的走路方式于是大量生成结果看起来像样板戏动作标准、情绪缺失、镜头僵死。1.1 提示词写作对象变了从“文案建模”到“画面调度”对话模型时代提示词是写给一个“会替你补全语义”的系统。视频生成模型时代提示词是写给一个“负责把文字翻译成视觉序列”的系统。这两个系统的补全方式完全不同。H3 这类模型核心是把文本描述映射成连续图像帧。它既要有单帧的构图和角色一致性又要保证多帧之间动作连贯、空间稳定、物理基本合理。所以提示词需要承担的任务从“让模型懂你”变成了“让模型少猜”。我个人的体感是写 H3 提示词时应该把自己想象成导演、摄影指导和场记的合体。导演负责定“剧情上发生了什么”摄影指导负责定“镜头怎么运动、景别怎么变化”场记负责定“角色此时穿什么、从哪里走到哪里、动作在哪个节点发生变化”。这三层同时写清楚模型才有一个足够明确的视觉蓝本。1.2 为什么堆砌形容词反而会失效一个常见误区是用大量修饰词制造“文艺感”。比如“一位穿着精致红色连衣裙的美丽女孩在繁华都市的迷人街道上优雅地、轻盈地、梦幻般地走着。”这句提示词读起来没问题但模型要从中提取出可执行的动作描述就会发现动词只有一个“走”方向是模糊的镜头运动完全没有空间关系也不明确。修饰词多不等于画面信息多。模型只能从中捕捉到“红裙、女孩、街道”这几个实物词而真正需要的运动轨迹、光影方向、镜头推进信息全部缺失。所以我在判断一段 H3 提示词好不好时会先问三个问题画面里到底发生了什么——这决定事件。镜头是怎么运动的——这决定叙事节奏。主体的动作有没有物理约束——这决定会不会出现滑步、漂移、变形。三个问题都回答不上来时提示词再华丽也没用。1.3 提示词不是万能的它的边界在语义级控制要说清楚边界提示词能控制的是语义层不是像素层。你可以通过提示词让画面“发生一场雨夜追逐”但很难通过提示词精确“修好一根手指”或“让第 30 帧的衣摆角度正确”。后者需要依赖参考图、后处理、局部重绘或筛选帧。这个边界意识很重要。否则你会陷入一种自我消耗反复改提示词希望一个词解决所有问题改完发现画面该崩还是崩。更合理的思路是把提示词用来解决“大方向”把参考图、参数、后处理用来解决“精修细节”。如果连续生成多条结果都不稳定不要只改提示词。先确认模型版本、参考图质量、生成参数是不是已经偏离了你预期的基线。2. 社区里反复出现的 7 类优秀提示词共性是什么我整理了社区里那些效果比较稳定、且被反复拆解的提示词写法发现它们并不会把大段时间花在形容词堆砌上而是集中在七个方向上参考图约束、镜头语言、物理动作、空间层次、光影时间、批量槽位、负面排除。下面逐个拆解。2.1 参考图模式把“这是谁”提前定死H3 生成视频时很多人会同时上传一张参考图目的是锁定角色或场景。但参考图上传之后提示词里如果完全不提参考图模型容易把“保持角色一致性”当成默认值结果生成的角色只保留了部分特征越往后越跑偏。社区里有效的一类写法是在提示词中明确参考图的用途。比如“参考图中角色的发型、五官、红色外套保持不变角色从画面左侧走向右侧步态平稳双臂自然摆动。”这里的关键是用“保持……不变”把参考图锚定到具体特征上。另一个常见问题是一张参考图里同时有多个人物、复杂背景和各种杂物。模型需要从中挑出该保留哪个、该舍弃哪个会非常困难。社区里更稳妥的做法是参考图里只保留要锁定的主体背景尽量干净并且在提示词里明确“只保留参考图中的角色形象不保留参考图背景”。如果模型入口提供了“图像参考强度”或“特征保持”之类的参数记得配合调整。提示词负责声明意图参数负责控制整体强度。2.2 镜头语言驱动让摄影机成为第二个主角很多新手会把提示词写成一个“陈述句”一个男人在跑步。模型确实会生成一个男人在跑步但镜头固定画面平铺直叙看起来像监控录像。社区里效果更好的写法是把镜头作为句子的主语或动作的执行者。比如“镜头从街道远景缓慢推进跟随男人从画面右侧跑向左侧当男人经过路灯时镜头转到侧面略微拉低角度。”这类提示词能有效控制景别变化和镜头运动。因为视频模型对镜头运动有单独的语义理解你明确写出“推进”“跟随”“俯拍”“侧移”它更容易生成对应的调度节奏。判断标准很简单把你写的提示词删掉所有形容词只看动词。如果动词能完整讲清楚镜头怎么动、主体怎么动这段提示词大概率能出效果。2.3 物理约束描述对抗滑步和肢体漂移视频生成模型最常翻车的点之一是人物在画面中“飘”。脚底像抹了油身体移动轨迹和脚步不同步手臂动作幅度夸张转身时肢体扭曲。社区里几类优秀案例的共同特点是会给关键动作加上物理约束。比如“人物双脚交替踩地每步落地时有轻微停顿身体随步伐自然上下起伏上身保持稳定手臂摆动幅度随步伐节奏减弱。”这些约束词的底层逻辑是把模型容易随意发挥的“运动自由度”缩小。你也可以在提示词里加入更直接的要求“人物始终与地面接触不要出现滑步或太空步”“身体比例和动作符合正常人体运动规律”。这里要提醒一句物理约束适合写在“复杂动作”段落里不必每一句都加。如果整段提示词都是约束词画面会显得僵硬动态感反而下降。2.4 前后景关系把画面从“贴片”变成“层次”单帧提示词里我们通常只会写“有什么”。比如“一个女孩站在街角远处有车流”。但到了视频阶段模型还要处理前后景的相对运动。如果提示词里没有明确的空间层次模型会倾向于把所有元素压在同一平面上看起来就像人物贴在了背景上。社区里更优秀的写法是主动给出前景、中景、背景三个层次“前景是虚化的人影和路灯中景是主角从湿漉漉的石板路上走来背景是缓慢流动的车流灯光人物移动时背景保持稳定前景有轻微视差运动。”这类描述能让模型生成更自然的空间纵深和视差效果。尤其是带轻微镜头移动时前后景分离越明确画面越不容易糊成一片。2.5 光影与时间绑定用“时间感”替代滤镜感“傍晚”“黄昏”“清晨”这类词本身有效但效果不稳定。因为模型可能只把它理解成一种色调滤镜而没有把它落实到光源位置、阴影方向、环境反射这些具体视觉证据上。所以社区里效果好的提示词会把时间、光源、物体反应一起写清楚。比如“傍晚金色侧逆光人物影子拉长到画面左前方地面潮湿有灯光反光天空从浅蓝渐变为橘红。”这里的差异在于你给的不仅是“什么时间”而是“这个时间段的光线如何影响画面里的物体”。模型获得了可渲染的光影关系而不是一个抽象标签。2.6 可替换槽位批量生成的前提如果你只需要生成一条视频从头到尾写一段完整提示词没问题。但实际创作中一个项目通常要生成几十条素材不同角色、不同场景、不同运镜。如果每次都从零开始写效率低而且风格很难统一。社区里做 AI 视频效率较高的玩家会把提示词做成类似模板的东西。它有几个固定不变的字段只有少数几个位置允许替换。一个常见的结构是【固定风格】电影感浅景深自然光效 【角色槽位】一个白发、红围巾的女孩 【动作槽位】从画面左侧走向右侧偶尔回头看 【场景槽位】雪后的旧城区街道路灯暖黄色 【运镜槽位】中景缓慢横移跟随人物每次需要生成新素材时只替换对应槽位其他部分保持不变。这样做的价值不只是省时间更重要的是让一批视频之间的风格、镜头逻辑有连续性。2.7 负面排除明确告诉模型“什么不能出现”视频模型的负面提示通常不如图像模型那么灵敏。它更适合用来排除一些高频率、易识别的画面问题而不是做精细控制。社区里更有效的做法是把负面项集中写在一段固定描述里每次生成都带上。比如“避免出现肢体扭曲、面部变形、多根手指、文字水印、人物忽大忽小、脚底滑动、背景闪烁。”如果一个负面问题反复出现比如“人物在转身时五官崩坏”那就需要结合动作描述来限制“转身动作放慢面部保持朝向镜头”而不仅仅依赖负面词。负面提示的作用是降低概率不是根治问题。如果你发现某类负面词从来没起过作用可能是模型版本或采样参数对负面项的敏感度不够不要继续堆负面词先调整生成参数。3. 从案例里提炼出的六层提示词框架看多了社区里的优秀案例会发现它们背后并不只是“写得好”而是结构稳定。我把它们整理成六个层主题层、主体层、镜头层、环境层、控制层、排除层。这套框架也适合拿来做官方 Skill 模板的底层结构。3.1 六个层分别管什么主题层只解决“这个画面在发生什么”。它不是一段故事而是一句话的事件描述。比如“雨夜一名穿红衣的女子穿过天桥”。主题层的作用是给模型一个大方向避免它在多个事件之间来回跳跃。主体层解决“谁在画面里怎么做动作”。包括角色长相、服装、状态以及关键动作序列。动作序列要按时间排好先做什么、再做什么、最后是什么状态。镜头层解决“摄影机如何观察”。包括景别、运镜、镜头角度、是否跟随。对视频生成来说镜头层直接决定叙事节奏也最容易出效果差。环境层解决“角色处于什么样的空间里”。包括天气、时间段、光源方向、地面材质、前后景关系。环境层不只是背景板它会影响光影和反射。控制层是提示词跟工具能力之间的桥梁。比如参考图说明、首尾帧要求、运动强度提示。不同入口能力不同写作时需要根据入口灵活调整。排除层解决“哪些东西不能出现”。集中写高频负面问题减少生成后的人工筛选成本。3.2 一份可直接改写的提示词模板下面是一份通用示例结构。它不是固定文案而是提供一种组织方式。具体词要不要换取决于你要生成什么画面。【主题】雨夜一名穿红色风衣的女子快速穿过城市天桥 【主体】女子黑长发红色风衣面部清晰步伐稳定双臂自然摆动风衣下摆随步伐轻微晃动 【镜头】全景机位固定镜头缓慢推进女子从画面右侧向左行走经过画面中央时略微加速 【环境】夜晚城市街道天桥上灯光昏黄地面湿滑反光背景有虚化车流与霓虹灯 【控制】参考图提供角色形象保持发型、五官、服装一致背景不参考参考图 【排除】肢体扭曲、面部变形、多根手指、脚底滑动、人物忽大忽小、文字水印实际使用时可以先把这段跑一遍再逐步调整每个层。关键是每次只改一层不要一次改多个变量。否则你永远不知道是哪个改动让画面变好了。3.3 写完提示词之后先做一轮“删减”我见过不少同学写提示词写得越多越安心。但视频提示词不是论文模型对长文本的处理能力有限大量无效修饰反而会稀释关键动作和运镜。写完一段提示词后可以做一轮删减把可有可无的形容词删掉只保留会改变画面信息的词。把抽象表述换成具体动作“很美”换成“黑长发表情平静”。优先保留能驱动视觉变化的动词和空间词。删掉“非常”“极度”“超级”这类程度词视频模型通常不理解这些词的精确程度只会让它更飘。删减完再读一遍如果画面能在脑子里完整“播放”出来这段提示词就基本合格了。4. 官方 Skill 模板和导演台从“一条提示词”到“一套工作流”好的提示词能救一个画面但救不了一个低效流程。真正影响长期生产力的是你能不能把提示词沉淀成可复用的模板并和工具的工作流绑定。这也是官方 Skill 模板值得研究的原因。4.1 Skill 模板为什么有用又为什么不是万能从公开资料能看到官方 Skill 模板的作用通常是把复杂的提示词拆分到一些结构化字段中比如角色、动作、场景、镜头、光线、负面项。用户只需要在字段里填写具体内容减少面对空白输入框时的心理压力。它的价值在于“强制结构”。很多人写不好提示词不是因为词穷而是因为思路乱。Skill 模板逼着你先把事件、角色、镜头、环境分开想再往各个字段里填充内容。这相当于给了提示词写作一个脚手架。但模板不是万能药。它解决的是结构问题不解决审美问题。模板里写什么内容、怎么写动作、怎么描述镜头仍然需要你自己的判断。如果完全照搬模板填了一堆模糊词汇生成结果也不会好。4.2 把官方模板改造成自己的提示词库拿到官方模板后第一步不是立刻大批量生产而是用默认值跑一轮先把输出基线攒出来。基线是什么意思就是同一个模板、同一个随机种子、同一组参数下模型默认会给你一个什么样的画面。基线跑完后再按“每次只改一个字段”的方式做小步调优。比如先只改场景槽位其他字段都不动再同时改场景和运镜最后再把稳定效果存成一个“预案”。我的建议是按照这些场景维度积累预案人物近景面部特写、表情变化、轻微呼吸感空镜场景城市、自然、室内空间的光影和运动战斗动作跑动、转身、击打、镜头追随对话场景正反打、机位切换、前景遮挡转场镜头时间流逝、地点变化、光效过渡每积累一个预案都记录下提示词、参考图类型、步数、镜头参数等关键信息。以后做类似项目时直接调用而不是重新造轮子。4.3 当“导演台”接手运镜后提示词要做什么调整如果你使用的入口里有导演台或者有专门的镜头运动、首尾帧、运动强度设置提示词就不需要把所有镜头信息都塞进文案里了。导演台这类工具实质上是把“镜头口令”从自然语言里剥离出来变成可直接调整的参数。当这种面板可用时提示词应该回归到内容层重点描述事件、角色、动作、环境而把推拉摇移、镜头高低、运动速度交给参数面板。这是一个很容易踩坑的地方有人在面板里已经设置了镜头推进提示词里又反复写“镜头推进”两边叠加后画面可能出现过度推镜或运动幅度异常。养成一个好习惯先确认哪些动作由面板控制哪些由提示词控制。提示词负责补面板覆盖不到的部分。5. 最容易翻车的不是写法是排查顺序提示词写得再漂亮如果环境、模型文件、参数或工作流本身有问题生成结果一样会崩。很多人遇到问题就回头猛改提示词实际上浪费了大量时间。这里给一个可复用的排查链路按顺序来。5.1 按“现象、输入、环境、参数、提示词”逐层排查现象优先排查方向推荐动作生成失败、直接报错模型文件、节点、显存检查模型文件完整性查看 ComfyUI 或对应工具的控制台日志画面崩坏、人物变形参考图、提示词清空负面项只保留基础描述用最小样例验证镜头完全不动运镜参数、提示词中的镜头信息确认是否有导演台类参数接管运镜删除冲突描述动作幅度过大或过小运动强度、镜头参数先调参数再看是否需要在提示词补充物理约束人物前后不一致参考图、特征保持、提示词一致性描述精简参考图内容明确“保持角色形象”下载模型时网络超时网络、文件完整性重新下载并校验文件大小或哈希确认模型文件没有损坏排查时不要直接从提示词开始。先做一次最小验证把提示词删到只剩“一个人在走路”其他设置全部默认。如果这样都能崩说明问题大概率在环境或模型层面如果这样正常再逐步加回你的提示词看是哪一层引入了问题。5.2 本地部署场景的几个重点很多人在本地部署 H3 类模型时会遇到“官方效果在自己的显卡上打折扣”的问题。这里要明确一点本地跑的模型版本、量化方式、ComfyUI 节点适配情况和在线官方入口通常不完全一样。如果你用 ComfyUI 整合包一类的方式部署建议先确认几件事模型文件是否完整下载时有没有因为网络超时产生截断文件。当前加载的是全精度版本还是量化版本不同版本对提示词的敏感度可能有差别。ComfyUI 节点版本是否和模型版本匹配版本不匹配会导致节点报错或输出异常。显存占用是否处于安全范围。如果显存已经接近上限视频生成容易变得很慢或中途失败。不要一上来就追问“为什么我的效果不如官方演示”。先从模型版本、加载精度、工作流是否完整跑通这些基础问题排查。很多时候不是提示词写得不好而是工作流根本没有跑在正常状态。5.3 不要把别人的成功案例当默认基线社区里有很多效果炸裂的提示词案例看着很诱人。但你不知道对方用了什么参数、什么参考图、什么模型版本、什么种子。直接复制提示词到你完全不同的环境下效果大概率不一样。正确做法是把别人的案例当成“结构参考”而不是“参数真相”。学习他的提示词是如何分层、如何描述动作、如何组织镜头然后在自己的环境里重新搭基线。基线不同结果不同这是正常现象。还有一个常见误区是被人晒出的“抽卡”结果误导。生成视频本质上有随机性同样的提示词抽十次可能只有一次效果惊艳。那些被发出来的漂亮案例背后可能经历了多次筛选。不要把个例当成稳定能力。本地部署场景下先跑通最小流程再谈提示词优化。如果最小流程都无法稳定输出调提示词只会让你更难定位问题。6. 提示词能力的终局不是写好一段话而是沉淀一套资产写 MiniMax H3 提示词这件事正在变得越来越不像“文案创作”而更像“视觉系统配置”。你写的每一段提示词本质上都是在定义模型后续采样的方向。单个提示词只影响一次输出但一套经过验证的模板会影响你整个项目的生成质量和生产效率。6.1 以“场景”为单位积累预案我建议你从今天开始用一个简单的表格或文档按“场景”为单位维护自己的提示词预案库。每个预案里至少包含场景名称比如“雨夜城市空镜”“人物情绪特写”“战斗追逐镜头”使用场景适合用来做片头、转场、人物出场还是剧情片段提示词全文按前面提到的六层结构组织参考图要求参考图内容应该是什么、需要避开什么参数记录步数、种子范围、运动强度、参考图强度等效果记录哪条效果好哪条容易崩崩在哪个位置这套资产的价值会随着使用次数不断增加。你不需要每次重新发明提示词只需要在已有模板上做增量调整。6.2 给新人的起步建议第一次接触 H3 提示词时不要急着模仿复杂案例先做这三件事用一个最简单的场景跑通全流程确认模型和工具本身没有环境问题。写一段提示词时先回答“画面发生了什么、镜头怎么动、人物怎么走”三个问题。每跑出一条满意的视频就把对应的提示词和参数保存下来作为自己的首个模板。等积累到五到十条不同风格的模板后再回头看最初写的提示词你会发现当时的问题几乎都出在同一点想让模型替你完成判断自己却不提供画面调度信息。下次再有人问“MiniMax H3 提示词怎么写”不用急着给出一个华丽模板。先问问他“你希望画面里的那个人从哪里走到哪里镜头是看着他走还是跟着他走”这三个问题想清楚了提示词自然就到了该有的样子上。