ChinaModelAPI

新闻 / 模型观察 · 中国前沿

官方正式发布 GLM-5.3 智谱 / Z.ai 旗舰大模型
2026-08-14 · 模型观察 · 2026-08-22 更新 · API 已于 8 月 19 日正式商用 (GA) —— 详见专门的 API GA 简报

GLM-5.3 正式发布:后训练 Scaling 突破、网络安全能力涌现、权重两周后开源

Z.ai 于 8 月 14 日正式发布 GLM-5.3 —— 沿用与 GLM-5.2 相同的基座模型,所有性能提升均来自大规模后训练。该模型现已面向 所有 GLM Coding Plan 订阅用户上线,在思考参数上带来了一项 API 不兼容变更,挖掘真实漏洞的效率甚至超出了其开发团队自身的预期,并将在 约两周后开源权重8 月 22 日更新:API 已于 8 月 19 日正式 GA(定价为每 1M tokens $1.40/$4.40,与 5.2 相同)—— 完整时间线、各平台支持名单及开发者注意事项现已收录于 专属 API GA 简报 中。下文附有完整数据、迁移预警及海外反响。

核心结论

GLM-5.3 已正式发布(2026 年 8 月 14 日)。 官方公告称: “今天我们正式发布 GLM-5.3。它采用了与 GLM-5.2 相同的基座模型 —— 所有提升均来自后训练。” Z.ai 称其为 “编程能力最强的开源权重模型”(在其自研 Z.ai Code Bench 上提升达 50%),并且在漏洞挖掘评测 CyberGym 上达到 SOTA 表现。上线状态: GLM Coding Plan —— 向所有订阅用户开放(基于积分的额度;享受 50% 闲时折扣); API —— 文档已更新且必须进行迁移(三档思考强度 low/high/max,且 thinking.type: "disabled" 已移除 —— 旧请求将会失败); 权重 —— 预计约 8 月 28 日发布(在完成安全加固后;截至 8 月 19 日尚未上传至 Hugging Face)。API 定价现已公布:每 1M tokens 输入 $1.40 / 输出 $4.40(缓存输入 $0.26)—— 与 GLM-5.2 完全一致,OpenRouter 也以相同价格上架了 glm-5.3(8 月 18 日)。首个独立评测结果已出炉:Artificial Analysis 指数 60(排名 8/182)。 对于中转服务上的生产环境:建议先留在 glm-5.2,直到 5.3 上游全面可用且服务稳定。

官方核实状态一览

项目状态(基于官方来源,2026-08-14)
官方公告官方博文已上线:z.ai/blog/glm-5.3(“今天我们正式发布 GLM-5.3”)
GLM Coding Plan已向全部订阅用户开放;基于积分制额度;闲时享受 50% 折扣(高峰期 = 工作日 14:00–18:00 UTC+8)
API模型页面与文档已上线;glm-5.3 支持思考强度 low / high / max(默认为 max);不再支持禁用思考。自 8 月 18 日起已在 OpenRouter 以同等价格上架
权重已开源“在发布后两周内,待安全评估与加固完成后提供” —— 截至 8 月 19 日尚未上线 Hugging Face(zai-org);预计约 8 月 28 日
上下文 / 输出1M 上下文 · 128K 最大输出 · 文本输入 / 文本输出(无原生视觉能力)
API 定价输入 $1.40 / 缓存输入 $0.26 / 输出 $4.40 每 1M(docs.z.ai 国际美元定价,8 月 19 日核实)—— 与 GLM-5.2 相同。Coding Plan:积分制,闲时 50% 折扣
更新日志记录docs.bigmodel.cn 模型页面已上线;截至发稿时 release-notes/changelog 页面尚未同步更新

本次发布顺序为博客 + Coding Plan 先行,更新日志随后跟进 —— 与“文档先行”的发布节奏正好相反。如果你以“更新日志里有没有”作为信号,就会慢半拍。

各项数据(厂商公布,摘自官方表格)

以下所有得分均为 Z.ai 在官方公告中公布的数据。仅摘录部分项目;博文中的完整表格涵盖约 20 个基准评测。

基准测试GLM-5.3GLM-5.2Kimi K3Opus 4.8Fable 5 / GPT-5.6 Sol
Terminal Bench 2.188.281.088.385.088.0 / 88.8
Terminal Bench 3.028.34.617.421.133.7 / 34.6
DeepSWE v1.166.946.267.558.069.7 / 72.7
SWE-Marathon v1.142.519.448.148.833.1 / 42.5
Agents' Last Exam (CLI)28.523.827.625.723.8 / 28.6
HLE w/ Tools62.554.759.857.963.9 / 64.5
GDPval-AA v217691508168215881743 / 1730
CyberGym84.577.280.078.183.8 / 83.6
ExploitBench54.424.432.240.078.0 / 76.5
  • 客观解读评测表:GLM-5.3 在代码与 Agent 评测项中基本打平或超越了 Kimi K3 和 DeepSeek-V4-Pro-0813(DeepSWE 62.7),与 Opus 4.8 旗鼓相当或略胜一筹,但在难度最高的项目中(Terminal Bench 3.0、DeepSWE、ExploitBench)仍落后于 Claude Fable 5 和 GPT-5.6 Sol。Z.ai 自身也坦言,虽然在这些领域提升最为显著,但与闭源顶尖模型之间的差距依然最大。
  • Token 效率:在自研的 Z.ai Code Bench 上,5.3 在 High 思考强度下仅消耗约 50K 输出 tokens 即达到 31.4%,超过了 Opus 4.8 消耗 120K tokens 取得的 29.5%;而 Fable 5 仍以 39.5% 保持领先(Max 强度)。
  • 厂商官方宣传(仅供参考):“编程能力最强的开源权重模型”、Terminal Bench 3.0 与 ALE 上的开源 SOTA、编程体验约 50% 的提升。独立第三方验证将随约两周后权重的发布而到来。

首份独立第三方评测:Artificial Analysis(8 月 18 日)

Artificial Analysis 于 8 月 18 日收录了 GLM-5.3 —— 这是首个非厂商官方评测。摘自其 模型页面(数据抓取于 8 月 19 日):

  • 智能指数(Intelligence Index)v4.1.1:60 分 —— 在 182 个模型中排名第 8(中位数为 35);在权重正式开源前暂列为专有模型;生成速度 84.7 tok/s,首字延迟(TTFT)1.88s,支持 1M 上下文。
  • 定位对比:在 max 思考强度下,HN 基准讨论帖汇总的 AA 追踪数据显示,GLM-5.3 为 59.5 分,对比 Kimi K3 为 59.7 分、GPT-5.6 Sol 为 60.9 分、Claude Opus 5 为 61.5 分 —— 与 K3 基本持平,仅略逊于闭源顶级模型,相比 GLM-5.2 的 53.0 分提升了约 7 分。
  • 注意事项 —— 冗长(Verbosity):AA 明确将 GLM-5.3 标记为“极度冗长”(very verbose):在整个指数测试过程中输出了 170M tokens(中位数为 72M),单任务平均输出 tokens 约为 41k,而 GPT-5.6 Sol 约为 16.9k。Token 消耗效率而非单纯的智能水平,是控制成本的关键关注点。
  • 截至 8 月 19 日尚未上线 LMArena(已直接核实)。

网络安全能力立足实战,不仅停留在跑分

本次发布最引人注目之处在于:Z.ai 与国内多家安全团队合作,将 GLM-5.2/5.3 应用于真实代码库。经过专家审核与去重,模型共挖掘出 分布在 269 个项目中的 2,436 个漏洞,其中包含 1,097 个中高危问题(官方严重等级图表显示 107 个严重 + 990 个高危)—— 覆盖操作系统内核、浏览器引擎、开源基础设施、Web 应用及网络协议。其中最久远的漏洞可追溯至 1981 年;漏洞在被发现前的平均潜伏期达 26.6 年

  • 所有发现均汇总至公开的 Z.ai 安全披露台账 —— 据 unite.ai 报道,发布时已有 53 个漏洞公开并分配了 CVE,其余 2,383 个仍处于未披露期(包括 Linux 内核 use-after-free、WebKit/Safari 内存错误、FreeBSD 参数校验漏洞等)。
  • 在漏洞利用深度评测中表现出一致趋势:相比 5.2 有大幅提升(ExploitGym 2 小时任务数从 29 项激增至 105 项),但仍明显落后于 Mythos 5 和 GPT-5.6 Sol。这是一项强大的防御/安全审计能力,而非进攻性前沿工具。
  • Z.ai 官方表示:随着后训练规模扩大,该能力的“发展速度超出了预期” —— 这也是在权重正式开源前预留两周安全加固期的原因。

API 开发者:需要提前规划的一项不兼容变更

  • 必须进行迁移:GLM-5.3 支持思考强度 low / high / max(默认为 max,代码场景推荐)—— 且 thinking.type: "disabled" 已不再受支持。官方文档明确指出:在切换模型 ID 前,请务必将其改为 enabled 并设置 reasoning_effort,“否则请求将直接报错失败”。
  • Coding Plan 计费机制:该套餐现已改为积分制(输入、缓存输入和输出分别计费);工作日 14:00–18:00 UTC+8 为高峰期,其余时间(含周末)均按标准积分的 50% 扣除。ZCode 还提供 98%+ 的缓存命中率,并在 8 月 31 日前享受 1.5 倍额度加成。
  • 通过 ChinaModelAPI 等中转服务调用:生产环境建议目前维持在 glm-5.2;待上游 API 正式 GA 且服务稳定后,我们将上线 5.3 模型 ID。迁移时,请务必提前做好上述思考参数强制变更的调整。
  • 相同基座与规格:1M 上下文 / 128K 输出 / 相同的功能支持(思考过程、流式传输、函数调用、上下文缓存、结构化输出、MCP)—— 因此迁移只需替换模型 ID 与参数,并针对 Agent 循环运行回归测试即可。
  • 仍为纯文本模型:视觉能力是智谱社区反馈中最强烈的诉求;但并未包含在本次发布中。

海外反响(8 月 19 日更新)

  • VentureBeat 发表了最深入的英文报道(8 月 14 日):转述了官方表格,同时提醒 Z.ai Code Bench 属于厂商自研私有基准;报道了 Z.ai 开发者布道师关于 GLM-5.3 已在 Cursor 中发现“严重漏洞”的说法(截至发稿 Cursor 尚未证实);并引用路透社报道,指出两周权重延迟发布背后涉及“可信访问”权限控制机制。文中还列出了 Coding Plan 的促销档位(Lite $12.60/月、Pro $56、Max $117.60)—— 标注为促销价;而 Hacker News 用户反馈的标准价格为 $18/$80。
  • The Decoder“智谱 AI 发布 GLM-5.3,称其为最强开源权重编程模型” 为题进行了报道 —— 同基座后训练升级、Agent 任务提升最为显著、权重将于两周后开源、支持通过 Coding Plan / ZCode / Claude Code / OpenCode 使用。
  • Interconnects(Nathan Lambert)发表了最具实质性的独立分析:《GLM-5.3:中国实验室如何紧跟前沿步伐》 —— 认为评测分数“货真价实”,对蒸馏论调持怀疑态度,将其归功于更快的发布迭代节奏以及更聚焦的文本/编程范围;指出该模型据报道约 750B 参数(约为 Kimi K3 体积的三分之一),并援引了 Z.ai 年经常性收入(ARR)约 10 亿美元的相关报道。
  • 路透社(源自搜索摘要;原文需付费阅读):GLM-5.3“在网络安全防御测试中逼近 Anthropic 的 Mythos 5” —— CyberGym 84.5% 对比 83.8% —— 权重延迟发布与测试敏感网络安全能力的“可信访问”权限控制有关。
  • Hacker News发布讨论帖获得了 1,167 点赞 / 582 条评论;随后于 8 月 18 日跟进了 AA 评测讨论帖,8 月 19 日跟进了 OpenRouter 上架讨论帖
  • Reddit r/LocalLLaMA 社区建立了 “GLM 5.3 Released” 讨论帖并附带官方博客链接,核心亮点为权重将于“两周内”开源。
  • Reddit r/ZaiGLM 上使用 Lite 套餐的用户反馈,GLM-5.2 在公告发布前几天“回答风格出现了明显变化” —— 这与在 5.2 标签下进行灰度渐进式发布、而非一次性整体切换的推测相吻合。
  • unite.ai 以“超越训练预期的网络安全能力”为主题报道了本次发布,重点提及了涉及 2,436 个漏洞的披露计划以及 8 月底开放权重供独立验证的时间窗口。(注:unite.ai 标注该文章为 AI 生成并经编辑审核。)
  • Laurie Voss(LinkedIn)—— 一位广受关注的开源权重模型评论员 —— 评价 5.2 为当前首选,并指出“GLM 5.3 开源权重正在准备中”,在他看来 GLM 系列领先其他开源权重阵营约 6–9 个月。

发布 5 天后的社区综合反馈

  • 好评:安全研究人员称其为首个“能够接受并完整执行真实红队实战场景”的模型(WordPress 插件 0-day、RCE、内核漏洞利用适配 —— HN 第一手反馈);部分团队因安全工具频繁遭遇拒答摩擦而从 Claude 订阅迁移过来;AA 得分(60 分)符合发布首日测试者的直观印象,且可视化的思考推理 tokens 允许用户提前终止失控的 trace。
  • 差评/顾虑:回答冗长导致 token 消耗过大(AA 标记为“极度冗长”);关于 Coding Plan 相比 API 定价性价比的争论(“GLM 只有在 API 价格上才有优势”);对两周“安全加固”期可能悄悄削弱网络安全能力的疑虑;以及缺乏多模态能力 —— 这仍然是 Web 开发工作流中最迫切的需求。

一手信息来源

FAQ

GLM-5.3 发布了吗?

是的 —— 已于 2026 年 8 月 14 日在 Z.ai 官方博客上正式公布。Coding Plan 用户现已可用;开源权重将在约两周后发布。

GLM-5.3 如何定价?

现已公布:docs.z.ai 上显示 输入 $1.40 / 输出 $4.40 每 1M tokens(缓存 $0.26)—— 与 GLM-5.2 相同;OpenRouter 价格保持一致。Coding Plan 采用积分制并享受 50% 闲时折扣(高峰期 = 工作日 14:00–18:00 UTC+8)。

我的 glm-5.2 调用会报错吗?

不会 —— 5.2 依然保持 GA、开源权重并正常路由。但当你迁移到 5.3 时,thinking.type: "disabled" 的请求将会失败;请务必先迁移参数。

5.3 增加了视觉能力吗?

没有 —— 仍为文本输入 / 文本输出。视觉能力虽是社区呼声最高的功能,但并未包含在此版本中。

相关指南