发布日期2026-07-28 | 关键词Kimi K3 开源、MoonEP、FlashKDA、AgentENV、KDA、开放权重数据来源Moonshot AI 官方模型卡、GitHub 仓库与 LICENSE 全文、各 Infra 项目 READMEKimi K3 是 Moonshot AI 于 2026 年 7 月 27 日开放权重的原生多模态智能体模型总参数 2.8T、激活参数 104B官方自述为世界首个开放的 3T 级模型。本次发布的价值不止于权重本身——Moonshot 同时开源了支撑 K3 训练的三个关键 Infra 项目MoonEP动态冗余专家实现完美负载均衡的专家并行通信库MIT、FlashKDA基于 CUTLASS 的高性能 KDA 算子MIT与 AgentENV基于 Firecracker microVM 的分布式智能体环境平台MIT由 kvcache-ai 维护。这三个项目对多数团队的实际价值高于 2.8T 权重本身因为完整权重需要多卡集群HF 仓库含 96 个 safetensors 分片而 Infra 工具可以直接用在自己的模型训练上。架构层面K3 采用每 Block 三层 KDA 加一层 Gated MLA 的混合注意力全模型 69 KDA 24 Gated MLA配合 896 专家激活 16 个的 Stable LatentMoE官方称缩放效率相比 K2 提升约 2.5 倍。许可证为自定义的 Kimi K3 License对模型即服务业务设有连续 12 个月累计营收 2000 万美元的阈值。一、热点背景为什么这次开源的时间点特别关键K3 开源撞上了一场正在进行的政策博弈。据 Fortune、CNBC、Business Insider、Tom’s Hardware 等媒体 2026 年 7 月 24 日报道英伟达 CEO 黄仁勋用他人生第一条 X 帖文分享了一封由 25 家公司联署的开放权重政策公开信联署方包括英伟达、微软、Meta、Palantir等主张政策制定者避免对开放权重模型施加不成熟的限制premature restrictions据 Forbes 2026 年 7 月 25 日报道签名企业在一天内从 25 家翻倍至 50 家值得注意的缺席方OpenAI、Anthropic、Google 均未在名单上背景是华盛顿正在权衡对中国 AI 模型的禁令。K3 在这个窗口全面开源客观上成为了这场辩论的实证材料。二、核心架构三处设计值得单独理解1. 混合注意力3:1 的 KDA Gated MLA这是 K3 解决百万上下文内存问题的核心方案。传统 Softmax 注意力在处理百万级上下文时KV Cache 会撑爆显存。K3 的做法是按 Block 混合两种注意力层类型数量职责KDAKimi Delta Attention线性注意力69 层把冗长上下文压缩成固定大小的循环状态Gated MLA全局注意力24 层周期性保留全局信息检索能力这个约 3:1 的搭配是取舍的产物纯线性注意力省内存但丢细节纯全局注意力精确但内存爆炸。2. Attention Residuals允许当前层跨级直接读取之前所有层的特征表示缓解极深网络93 层中的信息损耗问题。3. Stable LatentMoE896 专家激活 16 个项目数值专家总数896每 token 激活16激活比约 1.8%共享专家2总参数 / 激活参数2.8T / 104B激活率约 3.7%层数93稠密层 1上下文长度1048576视觉编码器MoonViT-V2401M激活函数SiTU-GLU量化MXFP4 权重 / MXFP8 激活量化感知训练极度稀疏下保持训练稳定的两个关键据材料与官方模型卡SiTU-GLU 激活函数——解决传统 SwiGLU 在极端规模下激活值爆炸的问题Quantile Balancing分位数负载均衡——摒弃传统辅助损失函数改用动态调整偏差实现专家负载均衡三、实操一调 API门槛最低5 分钟可跑在platform.kimi.ai选择模型kimi-k3官方提供 OpenAI / Anthropic 双兼容接口。⚠️ 最容易踩的坑必须回传 reasoning_contentK3 以保留思考历史模式训练多轮对话和工具调用时必须把 API 返回的完整 assistant 消息原样传回包括reasoning_content和tool_calls不能只传content。importopenai clientopenai.OpenAI(api_keyYOUR_KEY,base_urlhttps://platform.kimi.ai/v1)messages[{role:user,content:Tell me three random numbers.},{role:assistant,# 关键这个字段必须原样回传reasoning_content:Ill start by listing five numbers: 473, 921, 235, 215, 222, and Ill tell you the first three.,content:473, 921, 235},{role:user,content:What are the other two numbers you have in mind?}]responseclient.chat.completions.create(modelkimi-k3,messagesmessages,streamFalse,max_tokens4096,reasoning_effortmax,# low / high / max默认 max)print(response.choices[0].message.content)若丢弃reasoning_content模型无法回答另外两个数字是什么——因为答案只存在于前一轮的思考内容里。三个使用要点思考始终开启会返回reasoning_content字段无法关闭reasoning_effort三档low/high/max默认max。官方评测数据均在 max 下取得推荐 Agent 框架Kimi Code CLI终端内用/model命令选择 K3四、实操二本地部署需要清醒的预期硬件门槛的真实情况据 Hugging Face 仓库数据K3 共 118 个文件其中 96 个 safetensors 分片。即便按 MXFP4 量化计算完整权重也需要多卡 GPU 集群消费级硬件无法承载。官方推荐的三个推理引擎引擎文档vLLMrecipes.vllm.ai/moonshotai/Kimi-K3SGLangdocs.sglang.io/cookbook/autoregressive/Moonshotai/Kimi-K3TokenSpeedlightseek.org/tokenspeed/recipes/models#kimi-k3量化版本社区产出社区已提供11 个量化版本可用于 llama.cpp、Ollama、LM Studio、Jan。另外官方 HF 页面也支持 Docker Model Runnerdockermodel run hf.co/moonshotai/Kimi-K3注意量化程度越高与官方评测成绩的差距越大。跑分参考价值随量化档位下降。五、实操三三个 Infra 项目对多数团队价值更高这是本次开源最被低估的部分——2.8T 权重你可能跑不动但这三个 MIT 许可的工具可以直接用在自己的项目上。1. MoonEP专家并行通信库解决的问题MoE 训练中路由不均衡导致的算力浪费。据官方 READMEMoonEP 通过动态冗余专家实现无论路由如何倾斜每个 rank 都精确接收S × K个 token。特性说明完美负载均衡每个 rank 恒定接收S × Ktoken在线规划少量冗余专家并预取在线规划近最优 GPU 规划核开销可忽略零拷贝 静态形状融合 permute/unpermute只需固定S × K缓冲区静态形状消除每层 MoE 的主机同步官方 benchmarkH20EP8扫描路由不均衡度对比 DeepEP v2MoonEP 通信时间在每个不均衡等级都低于 DeepEP v2随 maxvio 增长几乎持平而 DeepEP v2 受最热 rank 拖累逐步退化端到端训练中DeepEP 在高不均衡时会因激活形状变化导致显存碎片直至 OOMMoonEP 因形状完全静态从不 OOM支持设备NVIDIA GPUZhenwu PPU审核中。仓库MoonshotAI/MoonEPMIT425 stars创建于 2026-07-242. FlashKDAKDA 高性能算子基于 CUTLASS 构建的 Kimi Delta Attention 内核。环境要求SM90 及以上H100/H800 及更新架构CUDA 12.9PyTorch 2.4安装gitclone https://github.com/MoonshotAI/FlashKDA.git flash-kdacdflash-kdagitsubmodule update--init--recursivepipinstall-v--no-build-isolation.为 CI 或 wheel 构建编译全部架构FLASH_KDA_CUDA_ARCHSall pipinstall-v--no-build-isolation.支持值为auto默认、all或逗号分隔的架构列表如90a,100a。作为 FLA 后端使用安装后会从flash-linear-attention的chunk_kda自动派发pipinstall-Uflash-linear-attention# 需 0.5.0importtorchfromfla.ops.kdaimportchunk_kdawithtorch.inference_mode():# 必须在 inference_mode 下调用out,final_statechunk_kda(qq,kk,vv,gg,betabeta,scalescale,initial_stateh0,output_final_stateTrue,)仓库MoonshotAI/FlashKDAMIT661 stars创建于 2026-04-203. AgentENV智能体环境平台这是支撑 K3 智能体强化学习训练的沙盒平台由 kvcache-ai 维护注意不在 MoonshotAI 组织下。核心能力据官方 README能力具体数据规模化运行跨机器运行大量 Firecracker 环境OCI 镜像通过 overlaybd 按需加载本地磁盘作为有界缓存镜像总量可超过磁盘容量空闲环境低成本快照支持的环境启动或恢复低于 50ms暂停低于 100ms原生快照与 fork增量快照内存与文件系统变更重度磁盘修改下仍低于 100ms运行中环境可 fork 成多个独立沙盒长期性能保持通过 ublk 提供高性能 I/O跨存储与内存快照共享宿主 page cache内存气球回收 guest 内存前置要求Linux 内核 6.8安装脚本额外要求 Ubuntu 24.04/dev/kvm访问权限Firecracker microVM 执行需要⚠️官方安全警告原文AgentENV 当前不支持授权认证。不要把 AgentENV API 暴露到公网只在受信任网络或带授权代理与网络管控的环境中运行。仓库kvcache-ai/AgentENVMIT657 stars创建于 2026-07-23六、许可证商用前必读的三条Kimi K3 License 不是 MIT 也不是 Apache 2.0而是带商业条件的自定义许可证。默认权利很宽松授予使用、复制、修改、合并、发布、分发、再许可、销售以及运行、部署、微调、创建衍生作品的权利。条件一MaaS 的 2000 万美元阈值许可证对「模型即服务」的定义是让第三方能访问语言模型推理或微调如通过 API且允许其对输入、参数或训练数据行使实质性控制。明确排除a模型能力仅嵌入特定功能或框架内的终端用户产品b仅转发请求给他人托管的模型。触发条件若经营 MaaS 业务且任意连续 12 个月累计营收超过2000 万美元须在商用前与 Moonshot AI 另签协议。条件二大规模产品需署名若用于月活超 1 亿或月营收超 2000 万美元的商业产品须在界面显著位置展示「Kimi K3」。两类豁免内部使用不向第三方提供软件、输出或底层能力通过 Moonshot AI 官方产品或认证推理伙伴访问你的情况是否受限个人研究、学习、微调实验✅ 自由企业内部使用✅ 豁免模型嵌在产品具体功能里✅ 不算 MaaS开 API 平台且年营收 2000 万美元⚠️ 需另签协议月活 1 亿或月营收 2000 万美元⚠️ 需署名七、评测数据客观看待能掰手腕官方评测把 K3 与 Claude Fable 5、GPT-5.6 Sol、Claude Opus 4.8、GPT-5.5、GLM-5.2 横向对比全部在reasoning_effort max、temperature 1.0下取得。K3 领先的项目基准Kimi K3Claude Fable 5GPT-5.6 SolSWE-Marathon42.035.039.0MCPMark-Verified94.587.492.9Harvey Lab-AA94.693.687.2BrowseComp91.288.090.4OmniDocBench91.189.885.8AA-LCR74.770.073.7τ³-Banking33.426.833.0Video-MME (w. sub)90.0—89.5K3 落后的项目基准Kimi K3Claude Fable 5差距HLE-Full43.5 / 56.053.3 / 63.0-9.8OSWorld 2.058.366.1-7.8OfficeQA Pro63.369.9-6.6FrontierSWE81.286.6-5.4Legal Research Bench44.249.5-5.3CritPt23.428.6-5.2GDPval-AA v2 (Elo)16861747-61两个评测设置细节需要知道据官方测评说明BrowseComp 的 91.2采用 300K token 触发的上下文压缩策略用完整 1M 上下文且不做上下文管理时为 90.4SWE-Marathon 基于 H20 校准分支且Claude Fable 5 在 35% 的任务上触发了 fallback——该项对比的可比性需谨慎看待客观结论K3 在智能体任务、工具调用、长上下文检索上确有领先但在最难的推理基准HLE-Full、CritPt和综合知识工作评分GDPval-AA v2上与 Fable 5 仍有可见差距。确立开源领域新边界成立全面超越闭源不成立。八、FAQQ2.8T 参数我的机器能跑吗A完整权重共 96 个 safetensors 分片需多卡 GPU 集群。消费级硬件请走社区的 11 个量化版本llama.cpp / Ollama / LM Studio / Jan或直接用官方 API。量化档位越高与官方跑分的差距越大。Q三个 Infra 项目能单独用在自己的模型上吗A可以三者均为 MIT 许可与 K3 权重的许可证独立。MoonEP 用于 MoE 训练的专家并行、FlashKDA 用于 KDA 类线性注意力算子加速、AgentENV 用于智能体 RL 训练的沙盒环境。对多数团队而言这三个工具的实用价值高于 2.8T 权重。QFlashKDA 对硬件有什么要求ASM90 及以上架构、CUDA 12.9、PyTorch 2.4。老一代 GPU如 A100SM80不满足要求。QAgentENV 可以直接部署到生产吗A需谨慎。官方 README 明确警告 AgentENV 当前不支持授权认证不要把 API 暴露到公网。只在受信任网络或带授权代理的环境中运行。另需 Linux 内核 6.8 与/dev/kvm权限。Q为什么必须回传 reasoning_contentAK3 在保留思考历史模式下训练多轮推理的连续性依赖前序思考内容。只回传content会丢失前一轮的推理上下文导致依赖前序思考的追问无法正确回答。QK3 支持视频吗A模型卡 Modality 字段标注为「文本、图像」但正文表述为在同一模型内理解 text、images、video且 Video-MMEw. sub取得 90.0。视频能力存在但未被列为正式模态。Q材料里提到的零日漏洞发现、48 小时设计芯片这些是真的吗A这些主张来自官方技术报告的案例展示部分。截至 2026 年 7 月 27 日主流科技媒体尚未出现对这些具体案例的独立验证报道。建议以官方技术报告原文为参考将其视为厂商自述的能力演示而非经第三方复现的结论。九、总结Kimi K3 开源的实际可用性分三个层次API 调用门槛最低但要注意reasoning_content回传本地部署需要多卡集群个人用户应走量化版本而 MoonEP、FlashKDA、AgentENV 三个 MIT 项目才是多数团队能立刻用上的部分。三个最容易忽略的点再强调许可证有 2000 万美元营收阈值和署名条款、AgentENV 不支持授权认证不可暴露公网、FlashKDA 需要 SM90 以上架构。据 Moonshot AI 官方模型卡、GitHub 仓库Kimi-K3 创建于 2026-07-27与三个 Infra 项目 READMEMoonEP 425 stars、FlashKDA 661 stars、AgentENV 657 stars均为 MIT以及 Fortune、CNBC、Forbes 关于开放权重政策公开信的报道2026 年 7 月 24-25 日本次发布正处于技术与政策的双重关注高峰。本文内容基于 2026 年 7 月 27 日的官方一手资料整理官方评测数据部分引自 Artificial Analysis、Vals AI 及各官方排行榜部分截至 2026-07-23。延伸资源Kimi K3 模型卡huggingface.co/moonshotai/Kimi-K3Kimi K3 GitHub 仓库github.com/MoonshotAI/Kimi-K3Kimi K3 License 全文huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE七牛云KimiK3 API 接入qiniu.com/ai/models