
上周实测 MiniMax H3 的时候我其实是抱着体验一下的心态好奇心还没有那么强。但开放权重后特别是7号晚上 H3 团队在 Reddit 办了场 AMA又在 ComfyUI 开了官方直播。看完我是真按捺不住想写点什么了。这两场活动很接地气我从三百多条评论里整理了六个大家最关心、都是大家心痒痒的热门问题• 2K 什么时候开• 24GB 显卡怎么跑• 能不能 4 步就出片• 用参考素材生成为什么反而更糊• 提示词到底该怎么写• 以后还开不开源我们把 AMA 全帖和直播完整看了亿遍收获颇丰还留意到几条之前没披露过的消息。由于信息量较大我上个周末就在全程梳理这篇算是给各位带来的超长省流版H3 能不能在消费级显卡跑第一个问题就相当实在H3 能不能在消费级显卡跑MiniMax 工程师把所有组件算上H3 总共有约 60B 参数也就是 600 亿。按标准精度存放光权重就要占约 120GB 内存。而旗舰消费级显卡只有 24GB甚至更少。消费级显卡不做任何优化模型连载入都做不到。等等之前不是说 33B 吗画一个重点33B 说的只是负责生成的那颗主干。而完整的 H3-Base 是一个全家桶里面还装着音视频的压缩解压模块以及一整颗 Qwen3-VL-32B专门负责看懂你给的图片和视频。这些加起来才是全部的负载。120GB 要怎么塞进消费级显卡的显存里工程师给了两条路子。第一招也就是我们的老朋友量化。ComfyUI 官方工作流现在用的就是量化版。第二招属于近期热门的工程方法分段卸载。只把计算真正用到的零件才搬进显存暂时用不到的在内存里排队有需要再加载。H3 在设计时就已经在这方面进行了优化33B 里有约 13B 参数属于一个调度分支它的工作结果可以提前算好存起来生成时这 13B 参数两甚至不用加载。得益于模型的设计在官方做量化ComfyUI 做调度社区做适配的努力下这颗巨无霸第一次有机会走进消费级显卡。当然得泼盆冷水塞得进去和好用是两回事。模型没法全部载入显存权重就要在内存和显卡之间来回加载。尝鲜的同学你懂的。直播评论区还问出了一个选购题如果用低成本显卡跑 H3买 5090 还是 RTX 6000 Pro工程师的回答是都行6000 Pro 部署相对省事5090 成本要低一些。H3占领了社区社区也占领了H3直播里让我印象最深的一段反倒和技术无关。主持人问团队H3 发布后最让你们意外的是什么回答是是社区的速度。开放权重不到 48 小时ComfyUI 的量化版、各种硬件的支持、Mac 上的 MLX 适配如雨后春笋冒出。团队说就是这种速度让他们觉得开放权重是非常正确的一步。直播里还专门说到了开发者 Kijai。这位社区开发者做了 ComfyUI 侧的量化最近又放出一个 4 到 8 步的加速 LoRA官方在直播里直接推荐显卡不给力的用户可以尝试。除他之外还有团队发布了另一个 4 步加速方案的预览版。这类方案的共同特点是走捷径。例如 H3 正常生成一段视频模型要反复计算约 20 轮才出片。加速 LoRA 就是教模型抄近道最少 4 轮出片轮数砍到五分之一。听着很香对吧但是 工程师原话加速 LoRA 能提速代价就是质量降低。 实测中步数压得太狠对人体结构、动作甚至声音的质量显然都有影响。 目前社区的经验看4 步是极限操作6到 8 步通常质量更佳而且负担并不完全随轮数降低而降低加载模型、分段加载、导出音视频也要占用一部分资源。为什么 MiniMax 乐见大家魔改直播开头团队就表示过开放权重就是想让企业和创作者自己部署满足保密合规的要求。也想让硬件厂商和开发者一起来优化把部署成本打下来。权重放出去之后决定 H3 怎么跑的可就不只是 MiniMax 了。AMA毒辣的网友vs敢说的官方AMA 完全是对开发团队刨根问底想不到网友还真问出了几条新消息。挑干货最足的说① 2K 马上就会到来这是被催更最狠的问题。我们简单交代下背景你本地下载的 H3 只能生成 768p要体验完整 2K 高清版需要经过 Regenerate-2K目前只能依赖官方的 API。传统超分的逻辑是拿一份低清结果猜它高清之后应该长什么样。问题在于如果低清视频里一行小字已经彻底糊掉超分模型只能猜测原来的内容。所以H3并没有采用传统超分模型它的做法是重新生成。把H3-Base产出的768p视频连同原始prompt、图片、视频、音频一起重新送回系统再生成一次2K版本。768p成片里丢掉的信息可以回原始素材里找。那 Regenerate-2K 会开放吗MiniMax 表示肯定会并且不会等太久。② 多快好省这条线官方在憋大招前面说了社区已经做出 4 步加速 LoRA。有人问MiniMax会不会出官方版团队的说法是还在积极探索中但无法在短期内提供毕竟底线是不能让用户明显感觉到质量变差。还有人问到显存优化的另一条路稀疏注意力。官方确认训练时已经用上了开源版本还没有发布近期会先给社区一个保守的参考实现第一目标是降低压力的同时避免质量损失。所以说现在大家在本地测出来的速度和成本很可能还没到H3的真实上限。③ 缺陷贴脸开大团队认真分析有用户反映画面里离镜头远的人脸容易糊成一团调到 2K、增加步数也无法改善。团队确认内部也观察到了坦诚的表示这个问题查不出单一原因牵扯模型里好几个环节是接下来的重点改进方向。另一个热议问题也得到正面回应用参考素材生成Ref2V确实比普通图生视频更容易发糊原因之一出在两个版本训练收尾方式不同也在改进现阶段的建议是参考素材尽量给最高清的。④ 一个没披露过的消息生图模型在路上社区里有个奇葩用法让 H3 只生成 5 帧的视频然后抽第一帧出来当文生图用所以有人问会不会出个正经的生图模型MiniMax 团队透露已经在做了从 H3 模型派生一个专门的图像生成模型目前在打磨收尾阶段。以后推荐玩法是先用图像模型定首帧满意了再交给 H3 生成视频。⑤ MiniMax的开源态度有人问以后的模型还开不开源。MiniMax回复只有一句“Keep open until AGI arrived”开放到 AGI 到来为止H3 目前用的是自家定制的社区许可证商用需要根据实际情况适配条款。有网友追问什么时候换成 Apache 2.0官方的回应是等版权文件处理完、法律环境更清晰会考虑换成 Apache 2.0。对准备搭建创业的小伙伴们非常值得期待~ComfyUI直播Demo赏析说到直播。进演示环节时ComfyUI 的 Rob 说了他的选择重点演示参考生视频社区最喜欢的玩法在开放权重的视频模型里也还算新鲜。这是 H3 最核心的思路。以前的视频工具人物参考、动作迁移、配音又是都是独立的流程现在一句话一次就能完成图 1管人物长相视频 1管动作和运镜音频 1管声音。一句话说清谁负责什么剩下交给模型。分工写得越清楚效果通常越好。一次最多能喂 12 个混合素材。Rob 现场跑了一条无线耳机的广告8 秒、480p在云端大约 1 分 46 秒出片。我们重看了成片效果浑然一体。在直播里 Rob 着重表示这个模型确实擅长把声音对到具体画面上社区夸得最多的口型同步靠的就是这一点。H3 的画面和声音由同一颗大脑在同一次生成里一起算出来它可不是先出无声视频再找模型配音。声音天生就长在画面的时间轴上。Rob 还顺手分享了一个口型小技巧对白音频作为素材传入后在提示词对应的时间段里用英文引号把台词原文再写一遍。相当于告诉模型这句话就是这个时间、这个人说的。声音、意思和嘴型钉在同一个点上翻车率明显下降。直播后半段专门留了时间看社区作品入选的帖子大多附带完整工作流和技巧小白也能轻松复刻。其中一支叫《When the Street Lights Bloom》的音乐视频带完整歌曲和人物表演作者连 4K 版和花絮都做了。Rob 特别指出角色的脸设计得非常离谱嘴型居然还能跟上歌声。另一条是猫钻毛毯的短片毯子随着猫移动的形变猫钻出来之后毛色花纹一根没乱。从抱怨到工具包最后讲一点我认为最能说明社区交流含金量。直播进行到一半Rob 正在讲模板评论区有人在说 H3 三方部署的为啥和官方效果差距明显MiniMax 现场就把这个问题揭秘了。他介绍了H3的预处理模块 Context-IR 的 API。简单的说在 H3 官方产品里你随手打的一句话其实会先被一位副导演Context-IR扩写成专业的分镜脚本再交给模型执行。这位副导演没有开源本地用户等于缺了这一环这也是官方效果和本地部署之间的一个差距来源。当然不用 Context-IR 的 API 的也行。AMA 里有人问副导演现在还没有开源能不能至少给个模板MiniMax 回答是已经备好了两套官方提示词指南一套对应基础玩法一套对应参考素材玩法扩写示例和输入模板都在里面。直播里工程师还补充道GitHub 上一共放了 9 个 Skill除了通用的提示词写作其余直接做成了具体场景产品广告、3D 动画短片、音乐视频拿来就能用。写在最后说实话MiniMax 给 H3 办的这两场活动太精妙了。取之于社区用之于社区。H3 刚发布的时候它是什么基本由 MiniMax 自己说了算33B 主干、三阶段系统。权重放出来之后这个定义开始松动了。有人给它瘦身有人搬上 Mac有人练 4 步加速有人抽帧当图像模型用。开发团队则在 Reddit 和直播里把 2K 开源、稀疏注意力、官方加速版、图像模型一条条摆上桌面连换 Apache 2.0 都进了考虑。这背后其实是一种态度。开放权重只是第一步更难得的是愿意走进社区听用户最真实的想法再把听到的变成下一步的 roadmap。开发者被认真对待才愿意把时间和创意投进来。社区越活跃模型生态就滚得越快。MiniMax 和社区之间正在形成这样一种正循环。总而言之MiniMax H3 交出了超出预期的答卷。是一个让社区再次活跃乃至躁动的新秀。官方表示完整的Tech Report在路上了。等它发出来有新的发现我也会第一时间再和大家分享。