2026 年 8 月 14 日智谱(Z.ai,港股 02513)发布 GLM-5.3。它没有换架构、没有堆参数(743B,与 GLM-5.2 同一基座),几乎全部能力提升来自后训练缩放——用更长程的任务环境、更丰富的环境类型、更长的强化学习时间来"榨"出上限。发布时点智谱 ARR 已达 10 亿美元(国内第一家迈过该里程碑的大模型厂商)。
743B 参数,与 GLM-5.2 同一基座,架构未变,提升全部来自后训练。
DeepSWE v1.1 66.9(开源第一);Terminal-Bench 3.0 4.6→28.3、SWE-Marathon 19.4→42.5。
CyberGym 84.5%,所有已评测模型中的第一(超 Mythos 5 的 83.8% 与 GPT-5.6 Sol 的 83.6%)。
网络安全能力太强反而"拖累"发布:权重与 API 因安全加固延后约两周,敏感能力分级为"trusted access"。
基于开源 Slime 框架训练,端到端 RL 吞吐较既有方案提升 2.3 倍,让"更长程、更大规模 RL 后训练"在成本上可行。
Effort Level 机制:四档推理深度(Non-Thinking 非思考 + Low/High/Max 三档思考)。注意:本文写作时(8/15)官方文档称 5.3 支持 Non-Thinking,但 API 强制开启思考,实际与后续官方口径(仅 low/high/max)存在出入——以官方最新文档为准。
因基座未变,5.2 时代的部署工具链、量化方案与推理基础设施可平滑迁移。
| 基准 | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Terminal-Bench 3.0 | 4.6 | 28.3 |
| DeepSWE v1.1 | 46.2 | 66.9(开源第一) |
| Agents' Last Exam (CLI) | 23.8 | 28.5 |
| SWE-Marathon | 19.4 | 42.5 |
| FrontierSWE | 67.5 | 78.1 |
| AutomationBench | — | 48.2 |
| GDPVal-AA v2 (Elo) | — | 1769 |
| Toolathlon Verified | — | 73.0 |
| HLE with Tools | — | 62.5–68.7 |
| Z.ai Code Bench(@ Max) | 23.4% | 34.5% |
Terminal-Bench 3.0:28.3 vs Fable 5(33.7)/ GPT-5.6 Sol(34.6),落后约 5–6 个点。
DeepSWE v1.1:66.9 vs Fable 5(69.7),落后不到 3 个点——差距从"代差"缩到"个位数",一年前开源落后闭源往往 20 分以上。
token 效率:Z.ai Code Bench 约 5 万 token/任务拿 31.4%,超过 Opus 4.8 用约 12 万 token 拿到的 29.5%——花不到一半 token 做得更好;仍落后 Fable 5(@Max 39.5%)。
价格定位:官方称 API 定价约为美国前沿模型每 token 单价的十分之一(5.2 口径约 $1.4/$4.4 每百万 token,相对 Fable 5 的 $10/$50 约 1/7~1/11)。
CyberGym 84.5% 全场第一;ExploitBench 54.4%(5.2 仅 24.4%,翻倍);ExploitGym 2 小时 105 个任务。
官方披露:识别 2,436 个开源项目漏洞(269 个项目),1,097 个高危/严重;最早漏洞可追溯到 1981 年,平均"发现滞后"26.6 年。
代价:权重与 API 延后约两周(预计 8 月底);敏感网络安全能力分级"trusted access",仅对审批合格用户开放;普通 API 用户被强制开启思考,只能在 low/high/max 中选择。
截至 8/15:API 与可下载权重均未上线;当前可用渠道只有 GLM Coding Plan 订阅、ZCode、AutoClaw(发布当日起全量开放)。
接入逻辑与 GLM-5.2 及其他 OpenAI 兼容模型完全一样——把 base_url 指向中转站的 OpenAI 兼容端点即可。
注意:安全分级意味着"能跑通 API"≠"拿到全部网络安全能力";强制思考意味着成本估算不能按非思考档的便宜价格算。
一句话评价:开源阵营第一,全体模型还不是第一;与闭源第一梯队差距从"代差"缩小到"几个点",但还没追平。
定位清晰:不是来抢"最强",而是抢"最强开源 + 最强性价比"(开源第一 + 价格约闭源 1/10 + token 效率优势)。
GLM-5.3