尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

智谱把 Opus 4.8 做到了 1/40 价格,背后是国产芯片撑住了 OpenRouter 榜首

智谱把 Opus 4.8 做到了 1/40 价格,背后是国产芯片撑住了 OpenRouter 榜首 昨晚 22:11 智谱上线了一个东西我先说三件事大家好我是船长。昨晚 22:11智谱把一个模型同时做了两件事——上线、原生开源。它叫GLM-5.3-Flash。先说三件事 第一件事AA 综合智能指数 57 分与 Anthropic 的 Claude Opus 4.8 持平已经迈进了全球前沿区间来源智谱官方 2026-08-26 22:11 推送。 第二件事输入 0.15 美元/百万 Token、输出 0.50 美元/百万 Token是 Opus 4.8 的 1/40限时折扣期内是 GLM-5.3 的 1/20来源Z.ai Pricing 文档。 第三件事过去 6 天它以Ox-Alpha / 牛来的化名偷摸上线 OpenRouter 和 OpenCode6 天吃掉 23.2T Token是第二名DeepSeek-V4-Flash 9.9T的2.34 倍并终结了 DeepSeek 在 OpenCode 上保持 56 天的霸榜所有这些流量跑在国产芯片上来源OpenRouter Top Models 8/20-8/25 周榜。本文仅为个人技术观察与工具评测分享不构成任何投资建议、产品推荐或购买指导AI 模型输出存在事实性错误风险请结合自身情况独立判断、核实后再用。大多数人对国产大模型又上新了已经免疫了。但这次不一样——它贵不到 1/40 了还顺手把美国算力才能跑得动的叙事踩了一脚。 你最近一次为 AI API 付费时账单上的数字是多少评论区报个数——我想知道这 1/40 对你是新闻还是体感。别把这次的开源和以前的开源混为一谈过去一年国产大模型开源了几轮口号都很响到手能用、敢用的不多。很多人心里默认了一个判断便宜的多半能力打折、开源的多半只是权重放出来让你看个热闹。GLM-5.3-Flash 把这三个误解一次给破了——这不是又一个性能打折的便宜货也不是砍掉一半能力换卡价的旧模型重发而是320B 总参数 / 18B 激活的全新架构激活参数比 GLM-4.5 的一半还少、层数从 92 降到 45 接近腰斩来源智谱公众号原文LLM Stats 详细规格。配合稀疏注意力 线性注意力的混合架构以及流形约束超连接mHC它把长上下文的算力成本砍到了 GLM-5.3 的1/3.01KV 缓存降到1/4.44。更直白一句在 DeepSWE 软件工程基准上10 项任务通过率约 80%超过了 Claude Fable 5 的 65% 和 GPT-5.6 Sol 的 52%来源智谱官方测评、AGI Hunt 评测。这种规格被摆在1/40 的价格档上对普通开发者的意义比又多了一个选择严重得多。核心真相参数大贵正在被摩尔定律之后的另一条曲线打破——同样的能力可以用更少的激活参数跑出来同样的质量可以用更便宜的算力供得上。这是 2026 年大模型赛道最该被盯紧的一件事。 你平时是用 API 计费、还是用 IDE 插件包月哪种看不见账单的用法最容易爆预算评论区聊聊。GLM-5.3-Flash 到底怎么用普通人/开发者分两条路对我来说这种发布最有价值的就是现在打开就能用不用等企业内测、不用排队、不用申请。下面把三条主流用法分开说说不想写代码的人直接用 Coding Plan。智谱给 GLM Coding Plan 用户全员额度重置用 GLM-5.3-Flash 的额度是 GLM-5.3 的3 倍非高峰时段和全天周末消耗的点数减半来源智谱官方运营 8/26 23:14 公告。新用户每天限量发 10000 张 7 天免费体验卡。直接打开 Claude Code / Cline把模型切到glm-5.3-flash就能在原 IDE 里用——不用切换工具。想自己接 API 的人Z.ai / BigModel 双入口。官方推荐参数temperature 1、top_p 0.95、reasoning_effort max、thinking 默认开启不能关。多模态走image_url内容块视频输入也在支持范围内来源Z.ai VLM 文档。缓存输入 0.03 美元/百万 Token 是个隐藏省钱点——同一段长上下文反复用成本再打折。想本地部署的人HuggingFace MIT 协议直接下。权重是MIT 协议zai-org/GLM-5.3-Flash 已开放不过有句实话——320B 总参数意味着所有权重都要常驻显存才能 MoE 路由别被激活 18B迷惑这不是一个能在家用笔记本跑的模型需要多卡服务器或用 vLLM / SGLang / TokenSpeed / KTransformers 官方推荐方案来源Fello AI 模型规格详解。结论选 API 计费用 GLM-5.3-Flash选 IDE 装插件切 Coding Plan自己跑模型前先量力而行——18B 激活背后是 320B 整体部署成本别被小模型叙事误导。同一份简历三档模型帮你改一次分别要多少钱用一份中文简历约 1.2 万字符 2 张设计稿示意让三个模型各改 5 轮差异不大的反馈仅做成本估算非真实账单、未含缓存折Claude Opus 4.8输入 15 美元/百万 Token、输出 75 美元/百万 Token 量级5 轮跑完约 4.5 美元。GLM-5.3老旗舰输入 1.40、输出 4.40 美元/百万5 轮约 0.42 美元。GLM-5.3-Flash输入 0.15、输出 0.50 美元/百万5 轮约 0.11 美元9 月 9 日前折扣 50% 后约 0.05 美元。结论同样的简历修改任务Opus 4.8 是 Flash 的约 41 倍几乎贴着官方 1/40 的口径。但贵不是绝对坏便宜也不是绝对好——如果改出来的事实性错误你还得人工复核一边那便宜省下的钱可能又还回去了。AI 模型的幻觉率才是真正的成本陷阱Flash 自报幻觉率 28% vs GLM-5.3 的 30%来源AGI Hunt表面只少 2 个点但跑 1 万次请求时累积的翻车次数差距是 200 条。 数据来源智谱官方公众号 2026-08-26 推送GLM-5.3-Flash 上线开源Z.ai Pricing 文档定价表、缓存输入 0.03 美元、MHV-Promo 至 2026-09-09 结束OpenRouter Top Models 8/20-8/25 周榜Ox-Alpha 23.2T Token 调用量AGI Hunt GLM-5.3-Flash 评测DeepSWE/AutomationBench/HLE w/ Tools、幻觉率新浪财经《智谱 AI 全 GLM-5.3 Flash 模型屠榜 OpenRouter》8/26 报道。本文仅做技术观察不构成投资/产品推荐。这模型也不是万能的把话说满之前先把限制摆桌上第一便宜是阶段性的。9 月 9 日 16:00 UTC 之前是限时折扣50% off之后回到 list 价格。9 月 9 日前是多薅一次的窗口9 月 10 日起要重新算账——预算测得保守别拿今天的价格去估明年的钱来源Z.ai 价格页 Promo 截止时间。第二能力不是全面碾压。在 HLE w/Tools 这个高难度基准上Flash 仍落后 Opus 4.8 和 DeepSeekAutomationBench 上 Gemini 3.7 Flash 的 52.3 仍比 Flash 的 48.8 高来源LLM Stats 详尽评测。Z.ai 自己也承认这不是 frontier-beating接近 Opus 4.8 配 1/40 价才是诚实说法。第三国产芯片撑住的不是单卡能力是集群吞吐。端到端服务性能提升 3 倍、单 Token 成本与主流 GPU 相当——这是大规模场景下成立不能解读为单张国产芯片就够了更不是国产芯片已经超越英伟达。9 月 9 日之前开发者真正该做的三件事立刻去薅 7 天免费体验卡打开 z.ai/subscribe 注册 Coding Plan新用户每天 10000 张体验卡切到 glm-5.3-flash 模型在你的 IDE 里跑一周把省下的账单数对一下。把现有 Pipeline 做一次降级备份9/9 之后回到原价Flash 仍然是便宜档但幻觉率别赌。建议给关键路径加一层 fact-check哪怕用规则别把看起来没问题当成真没问题。别把 1/40 当永久承诺把如果价格回升一倍还能砍多少自动化任务这个算清楚再上规模。先免费跑 7 天再决定是不是切主力。 你准备切主力模型吗还是观望一周评论区说说你的判断。觉得有用顺手发给还在为 AI 账单头疼的朋友——后面我会持续更新 AI 工具评估系列✅ 1/40 价 1/3 幻觉 vs 同价真实账单对比 ✅ 国产芯片在大模型推理里的实际位置 ✅ MIT 开源 Coding Plan 的成本上限一起在数据和逻辑里做更清醒的 AI 工具使用者。技术附录调用 GLM-5.3-Flash 多模态 API示意版下面用一段示意代码演示怎么调用 GLM-5.3-Flash 的 Z.ai 兼容接口含多模态 image_url 与缓存输入用法。⚠️ 以下为教学示意请按 Z.ai / BigModel 最新文档替换参数本文为示例不代表任何系统层级接口。Python · 调用 GLM-5.3-Flash 含图文示意版参数请以官方文档为准import os import requests # ⚠️ 仅为示意请按 Z.ai 官方文档替换 endpoint 和 API key 获取方式 API_KEY os.environ.get(示意_ZAI_API_KEY, ) ENDPOINT https://api.z.ai/api/paas/v4/chat/completions # 示意占位 def chat_glm_flash(messages, image_urlNone): headers { Authorization: fBearer {API_KEY}, Content-Type: application/json, } if image_url and len(messages) 0: messages[-1][content] [ {type: text, text: messages[-1][content]}, {type: image_url, image_url: {url: image_url}}, ] payload { model: glm-5.3-flash, # 官方建议thinking 默认开启 temperature: 1, top_p: 0.95, reasoning_effort: max, # 官方推荐 messages: messages, } resp requests.post(ENDPOINT, headersheaders, jsonpayload, timeout60) resp.raise_for_status() return resp.json() # 一次同时含文本 示意图 ans chat_glm_flash( [{role: user, content: 请帮我点评这张图里简历版式的两处可优化点}], image_urlhttps://example.com/sample_resume.png, # 示意占位 ) print(ans.get(choices, [{}])[0].get(message, {}).get(content, ))Python · 用缓存输入省钱的写法示意# ⚠️ 同段长上下文重复发会被提供者命中缓存输入 # 缓存输入 0.03 美元/百万 Token是 prompt 段重复利用的关键 SHARED_SYSTEM_PROMPT 你是文档校对助手关注事实性与表述精度。 # 示意文本 def chat_with_reuse(user_text, use_cacheTrue): payload { model: glm-5.3-flash, messages: [ {role: system, content: SHARED_SYSTEM_PROMPT}, {role: user, content: user_text}, ], # 示意开启缓存具体参数以官方为准 prompt_cache: use_cache, } return payload # 真正请求在 chat_glm_flash 里组装 # 反复调用同一份 system prompt命中的部分按 0.03 美元/百万计 # 没命中的部分仍按 0.15 美元/百万 Token 计占大头 # 更多量化 · AI 实战笔记微信搜「公重号船长Talk」 # 关柱本公重号后抬发「量化源码」玲取完整可运行代码 选股策略清单
返回列表