美团开源136亿参数视频大模型LongCat-Video:小白也能看懂的保姆级解析
美团开源136亿参数视频大模型LongCat-Video小白也能看懂的保姆级解析引言AI 视频生成卷到新高度了如果你关注过 AI 圈一定听说过文生视频——输入一句话AI 帮你生成一段视频。前有 Sora 惊艳全球后有可灵、即梦、Runway 各显神通。但过去的大模型有个通病视频一长就崩。生成 5 秒的短视频还行一旦要生成 1 分钟以上的长视频画面就开始鬼畜——颜色漂移、人物变形、动作穿帮。2025 年 10 月 25 日美团 LongCat 团队开源了LongCat-Video一个 136 亿参数13.6B的视频生成基础模型主打的就是分钟级长视频连贯生成。上线至今已在 GitHub 收获6000 Star成为开源视频生成领域的明星项目。这篇文章不堆术语用大白话把 LongCat-Video 讲清楚它是什么、厉害在哪、技术上有哪些门道、以及普通人怎么上手玩。一、LongCat-Video 是什么一句话它是一个能听懂人话、生成视频的超级模型而且一口气能干三件事。任务大白话解释应用场景文生视频输入一段文字描述生成对应视频一只橘猫在夕阳下打哈欠→ 出片图生视频给一张图片让它动起来给一张风景照 → 生成航拍运镜视频视频续写给一段已有视频接着往下编5 秒短片 → 续写成 1 分钟完整故事关键点是这三个能力不是三个模型而是同一个模型原生支持的。就像一个人既能写文章、又能画画、还能谱曲——不需要换脑子。二、它凭什么火四大核心亮点 亮点一长视频生成不翻车这是 LongCat-Video 最大的卖点。其他模型生成长视频容易出现颜色漂移画面色调越变越怪和质量退化后半段画面糊成马赛克。LongCat-Video 采用视频续写作为预训练任务——它天生就擅长接着上一段继续编所以能稳定输出分钟级的长视频画面质量始终如一。打个比方别的模型像一次性写一篇长作文写着写着就词穷了LongCat-Video 像一段一段接着写小说每一段都衔接自然。 亮点二统一架构一个模型打天下它把文生视频、图生视频、视频续写统一在一个框架里训练数据互相补充模型能力互相增强。用户不用根据不同任务切换不同模型一个 LongCat-Video 全搞定。 亮点三高效推理几分钟出 720p 视频生成 720p、30 帧/秒的视频只需要几分钟。它用了两条加速技术由粗到细Coarse-to-Fine生成策略先快速生成一个模糊的草稿视频再逐步细化成高清画面而不是一上来就精雕细琢每一帧。块稀疏注意力Block Sparse Attention让模型选择性关注重要区域减少大量无效计算——高清分辨率下尤其省力。 亮点四多奖励 RLHF越学越强模型训练后期用了GRPOGroup Relative Policy Optimization组相对策略优化——一种多奖励强化学习技术。大白话模型生成视频后多个评审老师奖励模型从不同维度打分——画面质量、动作合理性、文字匹配度。模型根据综合反馈不断改进自己越练越强最终在多项评测中逼近甚至超越顶级商业模型。三、技术内幕代码里藏着哪些门道对于想深入学习的朋友我们扒一扒仓库的代码结构GitHub: meituan-longcat/LongCat-Video。仓库结构一览LongCat-Video/ ├── longcat_video/ # 核心代码包 │ ├── modules/ # 模型组件 │ │ ├── longcat_video_dit.py # ★ 核心DiT 扩散 Transformer 主模型 │ │ ├── attention.py # 注意力机制含块稀疏注意力 │ │ ├── autoencoder_kl_wan.py # 视频 VAE 编解码器基于 Wan │ │ ├── blocks.py # 基础模块时间嵌入、PatchEmbed3D 等 │ │ ├── rope_3d.py # 3D 旋转位置编码 │ │ └── scheduling_flow_match_euler_discrete.py # 采样调度器 │ ├── block_sparse_attention/ # ★ 块稀疏注意力加速模块 │ ├── context_parallel/ # 上下文并行多卡推理 │ ├── audio_process/ # 音频处理Avatar 系列用 │ └── pipeline_longcat_video.py # ★ 推理管线6 万行级别的大文件 ├── run_demo_text_to_video.py # 文生视频 demo ├── run_demo_image_to_video.py # 图生视频 demo ├── run_demo_video_continuation.py # 视频续写 demo ├── run_demo_long_video.py # 长视频生成 demo ├── run_demo_interactive_video.py # 交互式视频 demo ├── run_streamlit.py # Web 界面 demo └── assets/ # 示例素材核心技术点通俗版1. DiTDiffusion Transformer架构LongCat-Video 本质是一个扩散模型 Transformer的组合体。扩散模型Diffusion先给视频加噪点直到变成纯雪花再训练模型一步步去噪还原出清晰视频。就像雕塑家先看一块石头再一点点凿出雕像。Transformer擅长处理序列数据视频本质是一连串带时间顺序的画面帧正好是 Transformer 的菜。代码中的LongCatSingleStreamBlock就是这种架构的基本单元包含自注意力self-attention、交叉注意力cross-attention用于把文字提示融合进视频和前馈网络FFN。2. 块稀疏注意力BSA视频注意力计算量巨大每一帧都要和所有其他帧互动。BSA 的思路是把注意力计算切成块只计算关键块大幅减少计算量。代码里block_sparse_attention/目录就是干这个的支持 FlashAttention-2/3、xformers 等多种后端。3. 上下文并行Context Parallel视频太长一块 GPU 显存放不下怎么办把视频切成几段分给多块 GPU 并行处理最后拼接。context_parallel/目录实现了 Ulysses 并行方案。这也解释了为什么官方 demo 推荐用torchrun --nproc_per_node2多卡跑。4. 3D 旋转位置编码RoPE-3D视频有宽、高、时间三个维度模型需要知道每一帧在什么位置。RoPE-3D 就是给视频加时空坐标的技术让模型理解空间布局和时间顺序。四、效果怎么样用数据说话官方在内部基准上做了 MOS平均意见分评测与市面主流模型对比文生视频对比指标Veo3PixVerse-V5Wan 2.2-T2V-A14BLongCat-Video架构闭源闭源MoE 28BDense 13.6B文本对齐3.993.813.703.76画面质量3.233.133.263.25动作质量3.863.813.783.74综合质量3.483.363.353.38图生视频对比指标Seedance 1.0Hailuo-02Wan 2.2-I2V-A14BLongCat-Video图像对齐4.124.184.184.04画面质量3.223.183.233.27综合质量3.353.273.263.17划重点LongCat-Video 只有 13.6B 参数而 Wan 2.2 是 28B 参数的 MoE 架构。用不到一半的参数量打出了接近甚至部分超越的成绩——这就是高效二字的含金量。五、小白上手指南怎么跑起来第一步环境准备需要一台有 NVIDIA GPU 的电脑建议显存 ≥ 24GB或用多卡系统装好 CUDA。# 1. 克隆仓库gitclone --single-branch--branchmain https://github.com/meituan-longcat/LongCat-VideocdLongCat-Video# 2. 创建 conda 环境conda create-nlongcat-videopython3.10conda activate longcat-video# 3. 安装 PyTorch按你的 CUDA 版本调整pipinstalltorch2.6.0cu124torchvision0.21.0cu124torchaudio2.6.0 --index-url https://download.pytorch.org/whl/cu124# 4. 安装其他依赖pipinstallninja pstuil packaging pipinstallflash_attn2.7.4.post1 pipinstall-rrequirements.txt第二步下载模型权重模型权重在 Hugging Face 上MIT 协议完全免费商用pipinstallhuggingface_hub[cli]huggingface-cli download meituan-longcat/LongCat-Video --local-dir ./weights/LongCat-Video第三步跑一个文生视频 demo# 单卡推理torchrun run_demo_text_to_video.py--checkpoint_dir./weights/LongCat-Video--enable_compile# 双卡并行推理更快torchrun--nproc_per_node2run_demo_text_to_video.py--context_parallel_size2--checkpoint_dir./weights/LongCat-Video--enable_compile想用网页界面一条命令搞定streamlit run ./run_streamlit.py--server.fileWatcherTypenone--server.headlessfalse小白提示硬件门槛13.6B 模型推理需要较大显存个人玩家建议用云 GPUAutoDL、恒源云等按小时租。提示词技巧描述越具体越好例如一位年轻女性留着黑色长发微笑说话穿着白色外套坐在明亮的咖啡馆里——丰富的细节能显著提升生成质量。长视频用run_demo_long_video.py可以生成分钟级长视频。六、彩蛋LongCat 家族的 Avatar 系列LongCat 团队不止做了视频生成还开源了数字人Avatar系列LongCat-Video-Avatar2025.12音频驱动人物动画输入一段语音生成人物说话的视频支持单人和多人对话场景。基于 Wav2Vec2 音频编码。LongCat-Video-Avatar-1.52026.5升级版换用 Whisper-Large 音频编码器口型同步更精准支持动漫、动物等风格化领域推理加速到 8 步蒸馏速度更快。想象一下以后你只需要一段录音 一张照片AI 就能生成照片里的人开口说话的视频——数字人直播、虚拟客服、有声绘本全都能做。七、总结对普通人意味着什么LongCat-Video 的开源意义可以归结为三点长视频不再是难题分钟级连贯生成的突破让 AI 从短视频玩具走向内容生产力工具。开源让门槛降低MIT 协议 完整代码 免费权重个人开发者、小团队也能基于它做二次开发。世界模型的第一步官方明确表示这是探索世界模型让 AI 理解物理世界运行规律的起点。能生成连贯视频的模型未来才可能真正理解世界。美团这次不仅秀了技术肌肉更展现了技术普惠的姿态——把最前沿的视频生成能力交到了每一个开发者手里。如果你对 AI 视频生成感兴趣不妨 clone 下来跑一跑。当看到自己写的一句话变成一段流畅的视频时那种造物主的快乐值得体验一次。本文基于 LongCat-Video 官方 GitHub 仓库meituan-longcat/LongCat-Video及技术报告arXiv:2510.22200整理分析。