尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

GLM-5凭什么逼近Claude Opus?3大基准测试结果深度解读

GLM-5凭什么逼近Claude Opus?3大基准测试结果深度解读 GLM-5凭什么逼近Claude Opus3大基准测试结果深度解读【免费下载链接】GLM-5GLM-5: From Vibe Coding to Agentic Engineering项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-5GLM-5 是面向复杂系统工程与长周期智能体Agentic任务的开源大模型744B 总参数、40B 激活预训练数据 28.5T tokens。它在 SWE-bench Verified、CC-Bench-V2、Vending Bench 2 三大基准测试中全面逼近 Claude Opus 4.5多项指标跻身全球开源模型第一梯队。本文用三张官方测试图带你快速看懂 GLM-5 的真实水平。GLM-5 是什么一句话看懂它的定位GLM-5 的口号是From Vibe Coding to Agentic Engineering从氛围编程走向智能体工程。与前代相比它做了三件事升级点GLM-4.5GLM-5参数规模355B激活 32B744B激活 40B预训练数据23T tokens28.5T tokens长上下文常规方案DeepSeek 稀疏注意力DSA长上下文下部署成本大降后训练常规 RLslime 异步强化学习基础设施训练吞吐与效率显著提升简单来说更大规模、更省部署成本、更强的智能体后训练——这三点正是它能在基准测试上贴近闭源旗舰的底气。基准测试一SWE-bench Verified代码修复只差 3 分SWE-bench Verified 是衡量大模型修复真实 GitHub Issue能力的公认标准。官方对比图中GLM-5 拿到77.8 分Claude Opus 4.5 为 80.9 分GPT-5.2 为 80.0 分——开源模型与闭源前沿的差距被压缩到了个位数。从这张覆盖 8 项评测的总表中还能看到几个关键点τ²-Bench智能体任务GLM-5 得 89.7仅落后 Claude Opus 4.591.6约 2 分大幅领先前代 GLM-4.787.4SWE-bench Multilingual多语言代码GLM-5 得 73.3同样逼近 Claude Opus 4.5 的 77.5Humanitys Last Exam带工具50.4 分显著领先 GLM-4.7 的 42.8说明深度推理 工具调用的组合明显更聪明。 对普通用户意味着让 GLM-5 帮你修 bug、读多语言代码库能力已经接近一线闭源模型。基准测试二CC-Bench-V2真实工程场景全面反超光会答题还不够GLM-5 在官方内部评估套件CC-Bench-V2模拟真实智能体工程工作流上前端与长周期任务直接反超 Claude Opus 4.5前端构建成功率GLM-5 达98.0%26%超过 Claude Opus 4.5 的 93.0%长周期大仓库探索65.6% vs 64.5%大项目里找得准的能力更强多步骤链式任务52.3% vs 61.6%仍是相对短板——这也是智能体长程任务的公认难题后端端到端正确率 25.8%与 Claude Opus 4.5 基本持平。 结论很清晰GLM-5 的强项在前端 长程规划这正是智能体工程的核心场景。基准测试三Vending Bench 2一年经营只花开源的钱Vending Bench 2 是最折磨人的基准让模型经营一家模拟自动售货机 365 天最终看账户余额。这是对长期规划、资源管理、抗干扰能力的终极考验。GLM-5 最终余额$4,432在开源模型中排名第一曲线走势与 Claude Opus 4.5 几乎平行Opus 约 $4,967而上一代 GLM-4.7 停留在 $2,377——一年经营利润直接翻倍长程耐力提升肉眼可见。三大测试结果背后为什么能逼近 Claude Opus把三张图串起来看答案就是开篇提到的三大支柱规模化Scaling744B 参数 28.5T tokens为推理与编码能力打下底座DSA 稀疏注意力长上下文能力不缩水部署成本反而大降长程智能体任务才能跑得久slime 异步 RL 后训练让模型在数百轮工具调用中持续迭代策略这是 Vending Bench 与 CC-Bench 长周期指标反超的关键。快速上手如何获取和部署 GLM-5想自己验证三步即可开始获取项目仓库git clone https://gitcode.com/GitHub_Trending/gl/GLM-5本地部署README 中列出了 SGLangv0.5.13.post1、vLLMv0.23.0、Transformersv0.5.12、KTransformers、Unsloth 等主流框架详见 README.md 的 Serve GLM-5 Series Models Locally 章节部署国产芯片可参考 example/ascend.md支持 vLLM-Ascend、xLLM、SGLang 等推理框架。⚙️ 小技巧GLM-5 支持reasoning_effort参数控制思考力度max/high榜单复现场景保持默认max即可追求响应速度可设为high彻底关闭思考则设enable_thinkingfalse。依赖环境见 requirements.txt。总结开源模型的新水位基准测试GLM-5Claude Opus 4.5一句话解读SWE-bench Verified77.880.9修 bug 只差 3 分CC-Bench-V2 前端构建98.0%93.0%反超 5 个百分点Vending Bench 2 余额$4,432~$4,967开源第一耐力翻倍 GLM-5 证明了开源模型在智能体工程这条赛道上已经能与闭源旗舰掰手腕。该仓库还包含后续版本 GLM-5.1、GLM-5.2 的资料——其中 GLM-5.2 已支持稳定 100 万 token 上下文并继续缩小与 Claude Opus 的差距值得持续关注。【免费下载链接】GLM-5GLM-5: From Vibe Coding to Agentic Engineering项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-5创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表