尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

【AI】中国 AI 实验室正在用开源的方式,把“最大、最强“的模型直接摆到全球开发者面前

【AI】中国 AI 实验室正在用开源的方式,把“最大、最强“的模型直接摆到全球开发者面前 本文导读2026 年 7 月国产大模型集体冲入万亿参数 开放权重俱乐部。月之暗面 Kimi K3、阿里通义千问 Qwen3.8 相继亮相DeepSeek、腾讯混元紧随其后。本文精选本轮最具技术含量的两篇重点报道翻译整理为中文带你一次看懂这场开源冲击波的技术底牌。目录一、写在前面二、重点文章一月之暗面 Kimi K3 —— 全球首个开放 3T 级大模型2.1 核心事实2.2 两个押注不只是把模型堆大2.3 性能与生态影响2.4 对开发者意味着什么三、重点文章二阿里 Qwen3.8-Max 预览版 —— 2.4 万亿参数原生多模态旗舰3.1 核心事实3.2 技术亮点全域多模态 稀疏激活3.3 落地场景与体验渠道3.4 开源的分量四、横向速览本轮其他重点动态五、总结一个属于开放前沿的夏天参考来源一、写在前面如果说 2025 年是国产大模型追赶的一年那么 2026 年 7 月这个夏天风向明显变了——中国 AI 实验室正在用开源的方式把最大、最强的模型直接摆到全球开发者面前。短短两周内7 月 16 日月之暗面Moonshot AI发布Kimi K32.8 万亿参数号称全球首个开放的 3T 级模型7 月 19 日阿里通义千问团队官宣Qwen3.8-Max 预览版2.4 万亿参数原生多模态旗舰7 月 27 日Kimi K3 权重正式在 Hugging Face 开源。更有意思的是在 OpenRouter全球主流模型调用路由平台上排名前五的模型全部来自中国团队小米 MiMo、DeepSeek、MiNiMax、阿里 Qwen、月之暗面 Kimi。下面我们挑两篇技术含量最高的报道逐条拆解。二、重点文章一月之暗面 Kimi K3 —— 全球首个开放 3T 级大模型编译整理自 Moonshot AI 官方发布、Hugging Face 模型卡及多篇技术深度报道July 16–27, 20262.1 核心事实7 月 16 日月之暗面正式发布 Kimi K3并于 7 月 27 日在 Hugging Face 公开全部权重。官方将其定义为全球首个开放的 3T 级3-trillion-class模型这也是迄今为止参数规模最大的开放权重模型。关键参数一览维度规格总参数量2.8 万亿2.8T架构MoE 混合专家Mixture-of-Experts专家数 / 激活数896 个专家每 token 仅激活16 个约 1.8%上下文窗口100 万 token1M模态原生视觉多模态native vision开源协议开放权重open-weight7 月 27 日全量放出量化支持 MXFP4 量化显著降低部署门槛2.2 两个押注不只是把模型堆大Kimi K3 最值得关注的地方不在于参数多而在于它在注意力机制上做了两处偏离主流配方的架构创新KDAKimi Delta AttentionKimi 增量注意力在超长上下文百万 token 级下传统全量注意力的计算与显存开销近乎不可承受。KDA 通过增量式的注意力更新机制让模型在长序列上保持高效推理。AttnResAttention Residuals注意力残差在注意力层之间引入残差连接思路缓解深层网络中的信息衰减提升训练稳定性与长程依赖建模能力。通俗理解MoE 让模型知识量巨大但每次只调用一小撮专家KDA AttnRes 则让它在超长文档里也能跑得动、记得住。二者结合才使得 2.8T 规模的模型在实际部署中具备可行性。2.3 性能与生态影响官方宣称 Kimi K3 的能力接近 Anthropic Fable 5当前公开可用的最强模型之一。发布后据彭博社报道模型上线驱动了月之暗面日销售额约 6 倍的激增。资本市场同样给出剧烈反应——有海外媒体将其称为**“第二次 DeepSeek 时刻second DeepSeek shock”**。与此同时月之暗面完成35 亿美元融资估值在半年内翻了三倍。2.4 对开发者意味着什么可自部署的前沿能力2.8T 开放权重 MXFP4 量化意味着有条件的团队可以在本地/私有云跑接近第一梯队的模型超长上下文落地1M token 上下文对 RAG、代码库级理解、长文档分析等场景是实打实的能力提升架构可借鉴KDA / AttnRes 为长上下文优化提供了新的工程参考。三、重点文章二阿里 Qwen3.8-Max 预览版 —— 2.4 万亿参数原生多模态旗舰编译整理自阿里云开发者社区、新浪财经及知乎技术专栏July 19–20, 20263.1 核心事实紧随 Kimi K3 之后7 月 19 日阿里通义千问团队发布Qwen3.8-Max-Preview总参数规模2.4 万亿是阿里云首款突破万亿参数的原生多模态旗舰模型。关键参数一览维度规格总参数量2.4 万亿2.4T架构MoE 混合专家 原生多模态上下文窗口原生128K特殊场景可无损扩展至1M模态文本、图像、短视频、PDF/HTML/Markdown 文档无需格式转换直接解析性能定位官方称综合实力仅次于 Anthropic Claude Fable 5开源承诺正式版开放代码、权重及推理部署方案3.2 技术亮点全域多模态 稀疏激活Qwen3.8-Max 把自己定位为**“全域复杂任务处理中枢”**核心卖点有三原生多模态、免转换可同时处理文本、图像、短视频以及 PDF、HTML、Markdown 等多格式文档无需提前做格式转换即可直接解析——这对文档智能、多模态 RAG 是很实用的工程优化。MoE 稀疏激活撑起万亿规模通过稀疏激活机制模型保持万亿参数容量的同时每次前向传播只激活一小部分专家网络这是万亿参数能真正跑起来的关键。工程级代码能力官方真实工程测评中其代码能力达到行业顶尖水准主打全栈开发、代码重构、漏洞批量修复、项目迭代优化等场景。3.3 落地场景与体验渠道Qwen3.8-Max 针对四类高端场景做了深度优化高难度工程开发、多智能体长周期任务、全链路办公自动化、海量数据分析。目前抢先体验依托阿里云三大平台上线百炼 Token Plan模型调用Qoder编码平台QoderWork办公终端3.4 开源的分量能同时进入**“万亿参数 开放权重”**俱乐部的模型全球屈指可数。阿里延续了通义千问一贯的开源路线承诺正式版开放权重——这意味着开发者未来有望在私有环境部署一个 2.4T 级别的多模态旗舰。四、横向速览本轮其他重点动态除了 Kimi K3 与 Qwen3.87 月国产大模型阵营还有几条不容错过的技术新闻DeepSeek-V4 系列推出 Pro1.6T/49B与 Flash284B/13B双模型原生支持100 万 token上下文采用全新CSA HCA 混合注意力架构大幅降本同时被曝正在推进自研 AI 推理芯片。腾讯混元 Hy3295B 总参 / 21B 激活的 MoE256K 上下文采用Apache 2.0商业友好开源协议混元语言与多模态团队合并成立基础模型部。百度昆仑芯 P800已在全国产集群上完成文心 5.1 重要版本训练交付多个万卡集群腾讯成为其客户字节亦在评估昆仑芯计划赴港上市。快手可灵 AI完成上限 30 亿美元外部增资投后估值 180 亿美元创全球视频大模型公司最大额融资纪录。五、总结一个属于开放前沿的夏天把这些碎片拼起来能看到一条清晰的技术主线国产大模型正在用开放权重 万亿参数 超长上下文 原生多模态的组合拳重新定义前沿模型的竞争规则。对我们开发者来说这带来的最直接红利是接近第一梯队的能力第一次可以以可自部署、可研究、可二次开发的形式拿到手里。无论是长上下文的 KDA、混合注意力的 CSA/HCA还是原生多模态的免转换解析都值得在自己的项目里认真评估一遍。万亿参数不再是巨头的专利秀而是逐渐变成开发者工具箱里的选项——这大概就是 2026 年这个夏天最重要的信号。参考来源China reshapes global AI landscape with trillion-parameter open-weight models — China DailyChina Narrows U.S. AI Gap With Moonshot AI’s Kimi K3, Alibaba’s Qwen 3.8 — Foreign PolicyKimi K3: A Technical Deep Dive into the First Open 3T-Class Model — HyperstackKimi K3 — 2.8T Parameters, MXFP4 QuantizationHugging Face Blogmoonshotai/Kimi-K3 · Hugging Face 模型卡Chinese LLMs Take Top Five Spots On OpenRouter — Dataconomy最新版通义千问Qwen3.8-Max-Preview功能介绍 — 阿里云开发者社区比肩 Fable 52.4 万亿参数与原生慢思考阿里 Qwen 3.8 预览版正式亮相 — 知乎阿里千问最强大模型 Qwen3.8 即将开源 — 新浪财经AI 应用周度观察2026.07.20–2026.07.26— 新浪财经✍️本文由 AI 辅助整理技术参数以各厂商官方发布为准。如果本文对你有帮助欢迎点赞、收藏、关注三连有想深入了解的模型欢迎评论区留言。标签#大模型#Kimi K3#通义千问Qwen#DeepSeek#MoE#开源模型#人工智能
返回列表