AI Weekly 7.27-8.2
本周 AI 快讯 | 1 分钟速览01DeepSeek V4-Flash 正式版上线9 项 Agent 基准全面超越自家旗舰 V4-ProTerminal-Bench 2.1 得分 82.7DSBench-FullStack 从 37 跃升到 68.7Artificial Analysis 智能指数 50 分几乎追平GPT-5.6 Luna的 51单任务成本低约 60%定价不变输入 1 元、输出 2 元百万 token。02Kimi K3 如期开源权重Arena 前端代码盲测一度登顶后被 Opus 5 反超7 月 27 日在 Hugging Face 放出完整权重2.8 万亿参数MXFP4 量化约 1.4TB开源时以 1679 分登顶 Arena 前端代码盲测随后被Claude Opus 5反超目前 1676 分排名第二Artificial Analysis 综合指数 57.1仍落后两家头部模型。03MiniMax H3 全模态视频模型发布8 月 3 日开源支持文本、图像、视频、音频多模态输入输出原生双声道音视频最高 15 秒 2K 分辨率成本不到主流竞品的三分之一权重将以 MiniMax Community License 开放。04字节发布 Seedance 2.5 视频模型单次可生成 30 秒支持最多 50 个全模态参考素材输入已上线即梦 AI 和豆包专业版API 近期接入火山方舟上一代 Seedance 2.0 已支持原生 4K。051324 名 AI 从业者联名要求设立国际减速机制签署者来自 OpenAI、Anthropic、Google DeepMind、Meta AI发布数小时内 OpenAI 和 Anthropic 以公司名义背书核心是建立预备减速能力并未要求暂停研发。06OpenAI 将 GPT-5.6 Luna 降价 80%Sol 用自己写的代码降本 20%GPT-5.6 Luna每百万 token 输入从约 7.2 元降到约 1.4 元、输出从约 43.2 元降到约 8.6 元GPT-5.6 Terra降约 20%同周GPT-5.6 Sol改写了自己推理引擎的内核代码端到端服务成本最多降 20%。07ChatGPT 周活即将破 10 亿比预期晚 7 个月当前约 9 亿周活用户外部有 Gemini 和 Claude 分流内部GPT-5上线后体验不佳拖慢增速同周 OpenAI 启动学术研究者计划先开放 1 万名2027 年前扩至 10 万名承诺投入超 18 亿元。08OpenAI 开源 Codex Security 安全扫描工具同日发布两款转录模型Codex Security CLI 和 SDK 以 Apache 2.0 开源支持扫描代码库、验证漏洞、接入 CI/CD1500 StarGPT-Live-Transcribe主打实时低延迟GPT-Transcribe主打异步批量错误率比Whisper降低一半以上。09Anthropic 披露 Claude 模型在评估中攻破三家公司源于第三方环境配置失误涉及Claude Opus 4.7、Claude Mythos和一个未命名模型测试环境本应隔离但第三方合作伙伴配置失误让模型获得了真实网络访问权限模型利用弱密码入侵了三家组织。10谷歌 Gemini Spark 接入 Chrome 代用户上网同周发布 Lyria 3.5 音乐模型Gemini Spark 新增 Chrome 自动浏览能力可代用户预约看房和检索航班付款等敏感操作交回用户确认率先在海外推出同步扩展到 160 多个国家Lyria 3.5可生成最长 3 分钟带人声曲目。11MCP 发布以来最大更新从有状态转向无状态核心2026-07-28 规范正式发布取消初始化握手每个请求自带协议版本和能力声明服务器可部署在无服务器和边缘环境月度 SDK 下载超 4 亿次今年增长 4 倍。12SpaceXAI 发布 Grok Voice Think Fast 2.0 语音模型Artificial Analysis 语音基准从 75.7% 升到 82.9%响应延迟从 1.25 秒降到 0.70 秒支持 25 种以上语言每分钟约 0.58 元。01DeepSeek「V4-Flash」正式版 9 项 Agent 基准全面超越自家旗舰同周启动内蒙古 1GW 数据中心7 月 31 日 DeepSeek 通过 API 文档发布日志宣布V4-Flash-0731正式版公测同架构重新训练API 调用方式不变。正式版在 9 项 Agent 和编码基准上全面超越了自家旗舰V4-Pro-Preview。Terminal-Bench 2.1 得分 82.7DSBench-FullStack 从预览版的 37 跃升到 68.7接近翻倍。Artificial Analysis 综合智能指数拿到 50 分几乎追平降价后GPT-5.6 Luna的 51 分但单任务成本低了约 60%。定价不变输入 1 元、输出 2 元百万 token缓存命中只要 0.02 元。据报道 DeepSeek 计划在内蒙古乌兰察布建设大型 AI 数据中心总容量 1GW。乌兰察布年均气温仅 4°C冷却成本远低于一线城市部分算力预计 2027 年底或 2028 年初投入使用。芯片方案尚未敲定英伟达和华为产品均在考虑范围内。02「Kimi K3」如期开源权重Arena 一度登顶后被「Claude Opus 5」反超7 月 27 日月之暗面如期在 Hugging Face 开源Kimi K3完整权重。2.8 万亿参数的稀疏 MoE每个 token 从 896 个专家中激活约 16 个约 500 亿激活参数上下文 100 万 tokenMXFP4 量化后体积约 1.4TB。上线 30 分钟内收获 4000 多个赞刷新了 Hugging Face 增长纪录。采用Kimi K3License年收入超过 2000 万美元的 AI 托管服务商需要单独获取商业授权。Kimi K3开源时 Arena 前端代码盲测以 1679 分一度登顶超过Claude Fable 5和GPT-5.6 Sol。但上期报道的Claude Opus 5随后以 1703 分反超Kimi K3目前 1676 分排名第二。Artificial Analysis 综合智能指数为 57.1同样落后Claude Fable 559.9和GPT-5.6 Sol58.9。开源前月之暗面团队在北京一家酒吧举行了庆功活动现场流出的标语写着「K3 扩容升级」「K4 给我狠狠干到极致」「冲上月球」。03「MiniMax H3」全模态视频模型发布8 月 3 日开放权重MiniMax H3打通了文本、图像、视频和音频四条通道。7 月 31 日 MiniMax 发布的这款新模型支持任意组合的多模态输入输出带原生双声道音频的视频最高 15 秒 2K 分辨率。用户可以提供参考视频、图片或音频素材配合文字指令完成音视频创作。成本不到主流竞品的三分之一。模型权重将在 8 月 3 日以 MiniMax Community License 开放非商用免费年收入低于 2000 万美元的公司商用也免费但需要署名。与上期 MiniMax 港股融资 160 亿港元、CEO 宣布「AGI 前零薪」相比H3 开源是一张更有说服力的名片。04字节发布「Seedance 2.5」视频模型单次可生成 30 秒7 月 31 日字节正式发布Seedance 2.5单次可生成 30 秒视频支持最多 50 个全模态参考素材输入。模型已陆续上线即梦 AI 和豆包专业版API 也将于近期接入火山方舟。上一代Seedance 2.0此前已升级支持原生 4K 生成。Seedance 2.5与MiniMax H3同一天发布Seedance 2.5侧重单段长视频的叙事连贯性MiniMax H3侧重多模态输入输出的统一架构。051324 名 AI 从业者联名要求建立国际「减速机制」7 月 28 日一封题为「Pacing the Frontier」的公开信发布1324 名来自 OpenAI、Anthropic、Google DeepMind、Meta AI 的员工签署。信中呼吁华盛顿支持建立国际协调的步伐机制在自动化 AI 研发速度超出人类安全监管能力时能够实施可验证的协调减速。发布数小时内OpenAI 和 Anthropic 以公司名义背书。签署者包括 Anthropic CEO Dario Amodei、OpenAI 首席科学家 Jakub Pachocki 和首席研究官 Mark Chen。公开信明确强调签署者并未要求暂停研发核心诉求是提前建立「在必要时能减速」的基础设施。上周 OpenAI 两款模型逃出安全沙盒攻入 Hugging Face 生产环境让这封信的时间节点多了一层紧迫感。06OpenAI 将「GPT-5.6 Luna」降价 80%「Sol」用自己写的代码降本 20%GPT-5.6 Luna降价 80%输入从约 7.2 元降到约 1.4 元、输出从约 43.2 元降到约 8.6 元百万 token按当前汇率折算。7 月 30 日 OpenAI 同步下调GPT-5.6 Terra约 20%GPT-5.6 Sol定价未变。距离 GPT-5.6 系列 7 月 9 日发布仅三周重新定价速度刷新了 OpenAI 的纪录。OpenAI 降价的底气来自效率提升。7 月 29 日 OpenAI 发布技术博文GPT-5.6 Sol改写了自己推理引擎的内核代码涉及 Triton 和 Gluon 两种编程语言的语法优化端到端服务成本最多降低 20%token 生成效率提升 15%。降价后的GPT-5.6 Luna每百万 token 输入约 1.4 元仍比 DeepSeekV4-Flash的 1 元贵 40%输出约 8.6 元更是后者 2 元的 4 倍多。07「ChatGPT」周活即将破 10 亿比预期晚 7 个月同周启动 10 万科学家计划比去年底的预期晚了 7 个月。7 月 29 日据报道ChatGPT 周活用户即将达到 10 亿当前约 9 亿。外部面临 Gemini 和 Claude 的分流内部GPT-5系列上线后体验不佳也拖慢了增速。今年 6 月 ChatGPT 月活已突破 10 亿但周活要达到同一数字门槛高得多。同一周 OpenAI 启动了 ChatGPT for Academic Researchers 计划先开放 1 万名研究者使用GPT-5.6 Sol等前沿模型2027 年前扩展到 10 万名。承诺投入超过 18 亿元支持科研数据不用于训练已在普林斯顿高等研究院和巴黎高等师范学院启动。08OpenAI 开源「Codex Security」安全扫描工具同日发布两款转录模型7 月 29 日 OpenAI 以 Apache 2.0 协议开源了 Codex Security CLI 和 SDK可以扫描代码库、验证漏洞、生成补丁并接入 CI/CD 流水线发布两天获得 1500 Star。Codex Security 今年 3 月进入研究预览这次正式开源。同一天OpenAI 还发布了两款转录模型。GPT-Live-Transcribe面向实时场景每分钟约 0.12 元。GPT-Transcribe面向录音文件和批量处理每分钟约 0.03 元错误率比Whisper降低了一半以上。两款模型都支持开发者预先提供关键词、人名和行业术语帮助模型理解上下文。09Anthropic 披露「Claude」模型攻破三家公司源于评估环境配置失误7 月 30 日 Anthropic 发布 Frontier Red Team 报告披露了三起真实网络安全事件。三起事件分别涉及Claude Opus 4.7、Claude Mythos和一个未命名的互联网研究测试模型它们在执行「夺旗」网络攻击评估任务时攻入了三家组织的真实系统。测试环境本应与真实互联网完全隔离但第三方评估合作伙伴 Irregular 的配置失误让模型获得了实际的网络访问权限。模型使用的手段并不复杂它们利用弱密码和不需要登录凭证的系统入口完成了入侵。Anthropic 将事件定性为双方的「误解」。同一周 Claude 服务也因两次网络故障宕机7 月 29 日和 30 日7 月 30 日晚间恢复Claude for Government 未受影响。10谷歌「Gemini Spark」接入 Chrome 代用户上网同周发布「Lyria 3.5」音乐模型Gemini Spark 接入了 Chrome 浏览器可以替你浏览网页干活了。7 月 30 日谷歌宣布 Gemini Spark 新增 Chrome 自动浏览能力获得授权后可以借助用户已登录的账号和已保存的密码代为预约看房、检索航班等。付款等敏感操作交回用户确认内置提示注入防护。率先在海外推出同步将 AI Pro 服务扩展到 160 多个国家。7 月 29 日谷歌还在 Flow Music 平台上线了Lyria 3.5音乐生成模型。相比上一代旋律结构更复杂人声更有表情歌词与指令的匹配度也有提升单曲最长可生成 3 分钟带人声曲目新增图片生成音乐功能。Lyria 系列 5 个月内已经迭代了三次。11「MCP」发布以来最大更新从有状态转向无状态核心问世 20 个月后MCP 迎来了最大的一次规范修订。7 月 28 日发布的 2026-07-28 规范将协议核心从有状态双向模式转为请求和响应模式取消了初始化握手流程每个请求自带协议版本和客户端能力声明。MCP 服务器可以直接部署在无服务器和边缘环境上不再需要维持长连接。新规范还引入了两项扩展。MCP Apps 让服务器可以向客户端推送交互式 HTML 界面Tasks 提供了一套无状态的长时间运行任务模型。MCP 的月度 SDK 下载量已超过 4 亿次今年增长了 4 倍已成为 AI 智能体连接外部工具的事实标准。12SpaceXAI 发布「Grok Voice Think Fast 2.0」语音模型响应延迟从 1.25 秒降到 0.70 秒。7 月 29 日 SpaceXAI 发布Grok Voice Think Fast 2.0Artificial Analysis 语音到语音基准从 75.7% 升到 82.9%支持 25 种以上语言每分钟约 0.58 元8 月 5 日起对现有用户自动生效。SpaceXAI 此前发布的编程模型Grok 4.5每百万 token 输入约 14 元语音模型每分钟约 0.58 元两条产品线都走了低价路线。