月之暗面发布Kimi K3:2.8万亿参数,开放模型走向复杂任务执行——赛柏特AI快讯
7月16日月之暗面发布新一代旗舰模型Kimi K3。该模型拥有2.8万亿总参数原生支持视觉理解并将上下文窗口扩展至100万Token。月之暗面将其定位为面向长程编程、知识工作和复杂推理任务的开放模型。目前Kimi K3已经接入Kimi网页端、Kimi Work、Kimi Code和API完整模型权重计划于7月27日前发布。首个达到2.8万亿参数的开放模型Kimi K3最直观的变化是模型规模进一步扩大。按照月之暗面的说法Kimi K3是首个达到2.8万亿参数的开放模型。模型采用混合专家架构每次处理Token时从896个专家中激活16个在扩大总参数规模的同时控制实际计算量。在架构上Kimi K3引入Kimi Delta Attention和Attention Residuals用于改善信息在长序列和深层网络中的传递效率。月之暗面称结合新的训练方式其整体扩展效率较Kimi K2提高约2.5倍。从生成代码到持续推进工程任务编程是Kimi K3此次重点展示的能力之一。传统代码模型更擅长回答单个问题、补全代码或修改一个文件而Kimi K3瞄准的是持续时间更长的软件工程任务。它可以在较少人工干预的情况下理解大型代码仓库、调用终端工具、修改多个文件并根据运行结果反复调试。在第三方评测中Kimi K3也表现出较强的网页界面生成和多步骤任务能力。发布时的评测结果显示其曾在Arena.ai网页界面构建榜单中位居第一并在Vals AI综合评测中排名第二。面向完整知识工作的Agent能力除了编程Kimi K3还将重点放在研究、分析和内容生产等知识工作上。凭借100万Token上下文模型可以在一次任务中处理大规模文档、代码仓库和历史对话并通过工具完成搜索、数据处理、图表制作和成果输出。目前Kimi Agent可调用20多种工具用于搭建网站、生成文档、分析数据等任务。开放模型开始竞争复杂任务能力Kimi K3释放了一个清晰信号大模型竞争正在从“谁更会回答问题”转向“谁能够理解更多信息、使用更多工具并将一项复杂任务持续做完”。这也意味着AI应用的运行方式正在发生改变。AI Agent需要在更长时间内持续读取数据、调用外部工具、执行代码并在多个步骤之间反复推理和修正。而随着AI Agent处理的任务时间更长、调用的数据和工具更多企业对算力供给、云端协同、数据传输和网络稳定性的要求也会同步提高。模型能力不断向前推进支撑模型持续运行的算网基础设施也将成为AI应用真正落地的重要基础。