AI 技术日报| 2026 年 7 月 28 日聚焦国产大模型与底层算力带你看懂本轮中国 AI 竞速的技术细节。引言刚刚过去的这段时间可以说是国产大模型的密集轰炸期。从阿里千问 Qwen 3.8 系列的正式亮相到 DeepSeek V4 全面开放再到智谱 GLM 系列的持续迭代加上阿里云自研 AI 芯片真武 M890超节点在 WAIC 上正式发布——国产 AI 正在从追赶逐步转向并跑甚至在开源权重open-weight赛道上已经建立起明显优势。本期日报挑选了几条偏技术方向、且以国内大厂为核心的重点新闻逐条拆解其技术细节供各位开发者参考。一、阿里千问 Qwen 3.8 Max2.4 万亿参数 MoE 预览版登场7 月 19 日阿里正式推出旗舰模型Qwen 3.8 Max预览版。这也是今年夏天参数规模最大的一次模型发布之一。核心技术要点架构稀疏专家混合Sparse Mixture-of-Experts, MoE总参数量高达2.4 万亿2.4T通过稀疏激活在推理时只调用一部分专家网络从而在保证能力的同时控制推理成本。多模态原生支持多模态输入。定位官方宣称其综合能力在全球范围内仅次于第一梯队的头部闭源模型位居前列需注意预览版发布时官方尚未公布完整的 benchmark 成绩这一说法有待第三方评测验证。可用性目前可通过阿里的 Token Plan 订阅方案接入使用。除了 Max 版本阿里在开源权重线上依然保持节奏——此前发布的Qwen3.6-27B2026 年 4 月 22 日仍是当前最新的开源通用 Qwen 模型兼顾了本地部署的可行性与能力。点评Qwen 3.8 Max 走的是大参数 MoE 稀疏激活的典型路线与 DeepSeek V4 的思路一致。这条路线的价值在于用超大参数堆能力上限再用稀疏激活把实际推理算力压下来。对开发者而言真正值得关注的是它的每 token 激活参数量和API 定价这两个指标直接决定了落地成本。二、DeepSeek V4 全面开放1.6 万亿参数、百万上下文、MIT 开源DeepSeek 在 4 月 24 日发布 V4 预览版后近期正式转为全面可用GA。这是本轮国产模型竞赛中最受关注的开源发布之一。核心技术要点双模型策略V4-Pro总参数1.6 万亿1.6T每 token 激活约49B。V4-Flash总参数284B主打轻量与高性价比。超长上下文通过 API 提供100 万1Mtoken上下文窗口配合其Lightning Index / Lookahead Sparse Attention稀疏注意力机制可将长上下文场景下的 KV Cache 显存占用压缩到全量的约13.5%这是长文本推理落地的关键优化。混合注意力架构采用 hybrid attention 设计兼顾短序列的精度与长序列的效率。开源协议两个模型均以MIT 许可证开放权重商用友好。API 定价参考V4-Pro 约 $0.435 / 1M 输入 tokens、$0.87 / 1M 输出 tokensV4-Flash 约 $0.14 / $0.28命中缓存的输入价格可低至 $0.0028 级别。点评DeepSeek 依旧延续了极致工程 开源普惠的打法。V4 最大的技术看点不是参数规模而是长上下文的显存压缩——把 1M token 的 KV Cache 压到 13.5%意味着长文档、大型代码库分析这类场景的部署成本被大幅拉低。对做 Agent、RAG、代码工具的开发者这是实打实的利好。三、阿里云灵骏真武 M890超节点单台承载十万亿参数级 MoE 推理在2026 世界人工智能大会WAIC上阿里云正式发布灵骏真武 M890 超节点实例并在内蒙古乌兰察布地域开放邀测。这是阿里云首次通过公共云对外提供超节点形态的 AI 算力服务意义重大。核心技术要点自研芯片搭载平头哥新一代训推一体 AI 芯片真武 M890内建144GB 显存片间互联带宽800GB/s官方称性能达到上一代真武 810E 的3 倍。超节点规模单个超节点通过ICN Switch 1.0互联芯片将64 张真武 M890高速互联整机显存规模达到约9TB。承载能力单台超节点可承载十万亿参数级10T的 MoE 大模型推理。生态适配7 月 23 日阿里云宣布真武 M890 超节点已成功适配最新旗舰模型Qwen3.8并已在百炼BaiLian平台上提供推理服务形成了自研芯片 自研模型 云平台的完整闭环。点评这条新闻的分量不亚于任何一次模型发布。当模型规模冲向万亿、十万亿参数级别算力底座就成了决定性因素。阿里云用自研芯片打通训推一体 超节点 公共云的完整链路既是对英伟达生态的正面回应也让国产超大模型有了不依赖进口高端芯片的推理落地路径。芯片、模型、云三位一体这才是大厂真正的护城河。四、字节跳动 Seedance 2.5单次生成 30 秒原生 4K 视频字节跳动在火山引擎 FORCE 大会上发布的视频生成大模型Seedance 2.5已于 7 月 16 日通过 BytePlus 国际云平台正式开放 API。核心技术要点单次 30 秒长视频最大亮点在于可以在单次推理中一次性生成长达30 秒的连续视频无需分段拼接no stitching。此前多数竞品的单次生成上限普遍在 8~15 秒需要靠多段拼接延长且容易出现前后不一致。原生 4K 同步音频直出原生 4K 分辨率并且画面与音频同步生成。全模态多参考输入支持最多50 个多模态素材作为参考输入配合3D 摄像机走位camera blockout控制大幅提升了对镜头语言的可控性。落地场景一次成型的长镜头能力改变了广告、短视频、影视预演等场景的制作流程。点评视频生成的核心矛盾一直是时长 vs 一致性。Seedance 2.5 用单次推理直出 30 秒本质上是在时序一致性建模上做了突破——不靠拼接就意味着人物、场景、光影在整段视频里能保持连贯。需要提醒的是多家媒体也指出这类超长视频在版权归属上仍存在未解风险商用时需谨慎评估素材来源。五、行业观察国产开源大模型的组团突围除了上述几条重点本轮竞速还有几个值得关注的信号智谱 GLM 系列持续迭代GLM-5约 744B 总参数、40B 激活的 MoE是目前中国生态中较强的开源权重模型之一据多方消息下一代基础模型GLM-5.5预计将在 8 月左右发布市场对其能否进一步逼近全球头部模型抱有期待。月之暗面 Kimi K3作为新一代国产开源权重模型发布参数规模据称达到 2.5 万亿级别正在推动大量企业级 AI 应用转向开源权重路线。一个共同趋势国产大厂在开源权重赛道上正形成合力。开源 低价 API 自研算力这套组合拳正在重塑全球 AI 的供给格局。总结把这几条新闻串起来看本轮国产 AI 竞速呈现出三条清晰的技术主线参数规模持续冲高但靠 MoE 稀疏激活控成本——Qwen 3.8 Max2.4T、DeepSeek V4-Pro1.6T都是典型。长上下文与显存优化成为工程竞争焦点——DeepSeek V4 把 1M token 的 KV Cache 压到 13.5% 是标志性突破。算力底座国产化提速——阿里云真武 M890 超节点打通了自研芯片 自研模型 云的完整闭环。对开发者而言最实际的建议是关注每 token 激活参数量、上下文成本和 API 定价而不是只看总参数这个面子指标。真正决定能否落地的永远是性价比。本文由自动化资讯助手整理编译内容基于公开网络信息部分数据如参数量、定价、benchmark以官方最终发布为准请以一手信源为准。参考来源Alibaba’s Qwen3.8-Max Claims Second Place — TechTimesQwen 3.8-Max: Release Date, Specs — YottaLabsDeepSeek V4 GA Architecture — Hugging Face BlogDeepSeek-V4-Pro-NVFP4 — Hugging FaceLightning Index Ultra-Long Context — arXiv阿里云发布灵骏真武 M890 超节点实例 — linux.doAlibaba Cloud Launches Lingjun Zhenwu M890 — LongbridgeByteDance Seedance 2.5 API Goes Live — CineDGLM-5 Guide — aicybrGLM-5.5 Release Rumors — felloai