中国 AI 初创公司 Z.ai(智谱国际名)于 2026 年 8 月 14 日发布 GLM-5.3,主打长程编程(long-horizon coding)能力大幅提升,以及更具争议性的网络安全能力跃升。据报道,GLM-5.3 的网络安全能力已经发现 Cursor(被 SpaceX 收购的 AI 编程公司)的一个"潜在严重漏洞"。
初期仅通过 GLM Coding Plan 和 ZCode 编程环境提供;API 与开源权重"待安全评估与加固完成后"再开放,权重预计发布约两周后放出。
对企业开发者而言,本次发布的核心不是又一轮跑分提升,而是同一基座、纯后训练的路线验证:Z.ai 称 GLM-5.3 使用与 GLM-5.2 相同的基座模型,全部提升来自扩展后训练(更多环境、更多样任务、更多强化学习算力)。"Scaling post-training is all we did for GLM-5.3."
| 基准 | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Terminal-Bench 3.0 | 4.6 | 28.3 |
| DeepSWE v1.1 | 46.2 | 66.9 |
| AutomationBench | 26.2 | 48.2 |
| Agents' Last Exam CLI | 23.8 | 28.5 |
对照:Terminal-Bench 3.0 上 GPT-5.6 Sol 为 34.6、Claude Fable 5 为 33.7;DeepSWE v1.1 上 GPT-5.6 Sol 为 72.7、Fable 5 为 69.7——即未全面超越闭源旗舰。
效率亮点(Z.ai 私有 Z.ai Code Bench):Max 档 34.5% @ 约 7.5 万输出 token/任务(5.2 为 23.4% @ 约 9.6 万);High 档 31.4% @ 约 5 万 token,超过 Claude Opus 4.8 的 29.5% @ 12 万 token。
Z.ai 原以为加入漏洞发现环境只会让模型更擅长"找漏洞",结果随着训练规模扩大,能力沿漏洞利用链(exploitation chain)快速延伸,"cyber capability developed faster than we expected"。
CyberGym(漏洞发现与验证):GLM-5.3 84.5% vs GLM-5.2 77.2%,略超 GPT-5.6 Sol(83.6%)与 Mythos 5(83.8%)。
ExploitBench(真实漏洞利用推理):54.4%,是 5.2(24.4%)的两倍多,但仍远低于 GPT-5.6 Sol(76.5%)与 Mythos 5(78%)。
ExploitGym:2 小时完成 105 个任务、6 小时 130 个(5.2 为 29/39);Fable 5 为 181/247,GPT-5.6 Sol 为 216/293。
实战:与中国安全团队合作,经专家复核共发现 2,436 个漏洞(269 个项目),其中 1,097 个为严重或高危;53 个已公开披露,2,383 个仍处于保密(embargo)状态。
路透社报道 Z.ai 正在为部分敏感能力引入"trusted access"(可信访问)控制。
GLM-5.3 支持 low / high / max 三档 reasoning effort(默认 max,官方推荐 coding 用 max)。
思考无法关闭:之前发送 thinking.type: "disabled" 的应用必须改为 enabled 并指定 effort,否则请求失败——这是一次真正的迁移,不是简单换模型名。
定位:开源模型能否"不花一次昂贵预训练"把前沿规模基座推到极限的试金石。
双刃剑:同样的长程 Agent 能力,既让模型更适合软件工程,也可能让它成为更强的攻击者。
"Scaling post-training is all we did for GLM-5.3."
"As we scaled post-training, cyber capability developed faster than we expected."
"That makes GLM-5.3 an actual migration rather than simply a model-name substitution for some production applications."
GLM-5.3