尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

从GLM-5.3到DeepSeek V4 Flash,后训练正在改写游戏规则

从GLM-5.3到DeepSeek V4 Flash,后训练正在改写游戏规则 引言2026年8月AI圈经历了一场密集的“模型雨”· 8月1日DeepSeek V4 Flash正式版API上线小参数激活仅130亿· 8月13日DeepSeek V4 Pro正式版转正1.6万亿参数旗舰· 8月14日智谱发布GLM-5.3参数与GLM-5.2完全一致仅后训练优化· 8月15日阿里开源Qwen3.8-27B270亿参数的稠密小模型。· GLM-5.3 在参数不变的情况下编程能力暴涨50%· Qwen3.8-27B 仅凭270亿参数就超越了自家前代更大的旗舰模型。这让人不得不问大模型的发展是不是已经进入了一个“堆参数失效”的新阶段一、小模型的“逆袭”后训练是唯一变量GLM-5.3同一个基座换了个“脑子”GLM-5.3基座参数为7430亿与GLM-5.2完全相同。所有提升全部来自后训练Post-trainingScaling。结果· 编程能力较前代提升50%· Terminal-Bench 3.0从4.6分飙升至28.3分6倍增长· DeepSWE v1.1从46.2%提升至66.9%· CyberGym得分84.5%超过GLM-5.2的77.2%。更关键的是在Z.ai Code Bench上GLM-5.3用仅5万tokens的输出达到了31.4%准确率而Claude Opus 4.8用12万tokens才拿到29.5%。同样的身体更聪明的训练方法更少的开销更好的结果。智谱官方甚至说“可能智谱还远未开发出这个基座的智能上界。”——基座潜力远没挖完。DeepSeek V4 Flash廉价版反杀旗舰V4 Flash总参数2840亿激活仅130亿。只靠重新做后训练DeepSWE分数从预览版的7.3%飙升至54.4%暴涨超过6倍。在Terminal Bench 2.1上得分82.7超过V4-Pro-Preview72.1和GLM-5.281.0。开发者实测反馈“flash的表现与pro预览版非常接近但价格便宜太多了”一个130亿激活的小模型硬是逼近了1.6万亿参数的旗舰。Qwen3.8-27B270亿参数的“奇迹”仅270亿参数的稠密模型整体水平超越Qwen3.7-Plus。Agentic terminal coding得分73.0前代63.4SWE-bench Pro 61.7前代53.5JobBench 33.4提升50%。而且量化后可在消费级显卡上流畅运行。这些案例合在一起指向同一个事实决定模型最终能力的不再是参数大小而是后训练的质量。二、趋势已经明朗从“卷参数”到“卷后训练”第一财经“壹评级”精准点评“小参数基座 定向后训练”的高性价比路线正在击穿企业规模化落地的成本阈值推动AI产业从拼参数、拼算力的上半场进入拼落地、拼效率的下半场。这个判断在8月的密集发布中得到了充分验证。· GLM-5.3 证明了同一个基座还能再榨出50%性能· DeepSeek V4 Flash 证明了后训练能让小模型追上大旗舰这就像同一辆车不换发动机只优化变速箱、控制系统和驾驶策略就能在赛道上跑出完全不同的成绩。预训练决定了智商下限后训练决定了能力上限。三、是天花板还是换了一层楼回到最初的问题大模型的发展真的到天花板了吗我的回答是预训练的“天花板”确实越来越近但AI能力的“天花板”还远未到来。区别在于· 预训练堆参数——数据快吃完了算力成本失控边际收益递减· 后训练优化方法——才刚刚起步GLM-5.3、V4 Flash、Qwen3.8都证明优化空间依然巨大。模型参数不再翻倍增长不意味着AI不进步。它只是换了一种进步的方式。从“卷参数”到“卷后训练”从“暴力美学”到“精细耕作”——这才是2026年大模型发展的真正叙事。至于那些还在怀疑“大模型是不是不行了”的人不妨看看GLM-5.3的Terminal-Bench 3.0同一个基座不同的训练方法4.6 → 28.36倍的差距。天花板更像是换了一层楼而楼梯才刚铺好。
返回列表