
细节一统一序列一个 Transformer 管所有模态传统多模态模型往往是视频模型 音频模型拼在一起。H3 的做法完全不同文本由 H3-Encoder基于 Qwen3-VL-32B 完整预训练权重编码视觉由 H3-Encoder H3-VisualVAE 编码音频由 H3-AudioVAE 编码三种模态的表示被组织成一条 packed multimodal sequence统一喂给 H3-Omni-Transformer。关键点在于H3-Omni-Transformer 的 attention 层和 FFN 层没有任何 modality-specific 结构——模态差异只存在于 input/output 层和 AdaLN 分支。这意味着什么模型更简洁、更易扩展新增模态时不需要改动主干架构。细节二MM-RoPE用三维位置编码表达时空视频本质是时间 两维空间的数据。H3 采用三维 Multimodal Rotary Position EmbeddingsMM-RoPE直接在 (t, h, w) 三个维度上表达位置关系。相比二维或一维位置编码它让模型天然理解画面里哪个位置、在哪个时刻的语义这是视频生成质量的基础。细节三双 VAE 各自安好H3 为视频和音频分别设计 VAE互不干扰又协同工作- H3-VisualVAE时间因果结构空间压缩 16 倍、时间压缩 4 倍latent channel 24f16t4d24。进 Transformer 前再按 1x2x2 patch 进一步 patchify等效 32 倍空间下采样。编码器训练完还额外训了一个基于 ViT 的 decoder 来降低解码成本。- H3-AudioVAE左右声道独立编码再重组32kHz 音频压缩成 40Hz 的 latent token 序列受 VA-VAE 启发做了 latent space 优化。细节四不用超分模型用 In-Context Regeneration 做 2K这是 H3 最反常规的地方。传统路线是生成 768p 再套一个超分辨率模型。H3 的 H3-Regenerate-2K 则是把 768p 结果连同原始多模态上下文一起重新送回 H3 基础模型再生成一遍 2K 输出。好处显而易见一是最大化复用基础模型的生成能力二是 in-context 形式让高分辨率生成能看到原始上下文里的小文字、精细细节而不是像传统超分那样靠猜测补信息。这就是官方所说的任务泛化的一个例子——同一个模型既能做 768p 生成又能做 2K 再生成。附带一提33B 参数里约 13B 在 AdaLN 相关分支推理时这部分调制输出可以预先计算并缓存无需加载这为部署留了很大优化空间。模型还支持原生稀疏注意力训练首版开源先给全注意力推理。从 768p 到 2K、从单模态到全模态、从专用模块到任务泛化H3 的每一步设计都在回答同一个问题怎么用最简洁、最可扩展的系统把多模态生成能力做到最强。这份开源代码本身就是给开发者最好的学习材料。