这篇社区分析把 GLM-5.3 的发布表拆成“编码/Agent 真实优势、闭源前沿仍领先、所有数字暂属厂商报告”三层,并给出可在权重或 API 开放后复现的自测项目。
适合的任务:判断“最强开源模型”与“最强模型”两种说法的差别;为真实仓库、长链工具调用和成本效率设计 A/B 测试。
不适合的任务:把作者的发布日分析当成独立跑分,或把 Z.ai 私有 Code Bench 的 50% 提升当作可外部审计事实。
适用的模型版本:GLM-5.3 与发布表中的 GLM-5.2、Kimi K3、Fable 5、GPT-5.6 Sol 对照。
适用的客户端、Agent 或 API:作者建议使用 Coding Plan/ZCode 做现阶段体验;独立 API 当时仍标注 coming soon。
推荐的推理档位和参数:原文只确认 low/high/max 对外暴露,未提供可复现实验参数;不要从本文推断最优档位。
资料范围:Z.ai 发布文章、模型文档、发布日媒体报道与社区可见讨论。
模型状态:2026-08-15 权重尚未开放,约两周安全审查后发布;因此作者没有自己的本地推理或 API 运行结果。
数据性质:文中逐项表格均注明为 Z.ai 自报;社区帖用于解释差距与设计后续复测,而非替代原始 benchmark。
作者建议用户在可运行版本开放后固定以下任务集合:
仓库级任务:跨多个文件导航、修改和验证一个真实 bug。
长链工具任务:记录至少 20 次以上工具调用的正确率、失败恢复和最终交付,而不是只看首轮回答。
结构化输出:要求严格 JSON schema,并记录校验失败率与人工修正量。
真实交付指标:记录每个完成任务的 token 消耗,而不是单条响应的 token;同时记录人类在交付前需要改动的次数。
| 基准 | GLM-5.2 | GLM-5.3 | 对照/边界 |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6 | 28.3 | Fable 5 33.7;GPT-5.6 Sol 34.6 |
| DeepSWE v1.1 | 46.2 | 66.9 | Kimi K3 67.5;Fable 5 69.7 |
| FrontierSWE | 67.5 | 78.1 | Fable 5 88.2 |
| SWE-Marathon v1.1 | 19.4 | 42.5 | 原文未列闭源对照 |
| AutomationBench | 26.2 | 48.2 | 原文未列完整对照 |
| Agents’ Last Exam | 23.8 | 28.5 | GPT-5.6 Sol 28.6 |
| HLE(with tools) | 54.7 | 62.5 | Fable 5 63.9;GPT-5.6 Sol 64.5 |
| CyberGym | 77.2 | 84.5 | Fable/Mythos 5 83.8;GPT-5.6 Sol 83.6 |
| ExploitBench | 24.4 | 54.4 | Fable/Mythos 5 78.0;GPT-5.6 Sol 76.5 |
| ExploitGym(2h/6h) | 29/39 | 105/130 | GPT-5.6 Sol 216/293 |
| GDPval-AA v2 | 未列 | 1769 | Fable 5 1743;GPT-5.6 Sol 1730 |
能支持的选择判断:GLM-5.3 的发布数据最强地支持终端编码、长程 Agent、自动化和白盒漏洞发现等方向;在 DeepSWE、Terminal-Bench、ExploitBench 等项目上,闭源前沿仍有明确优势。
“最强开源”不等于“最强模型”:文章按 Z.ai 自报表重算后认为,GLM-5.3 在 GDPval-AA v2 与 CyberGym 是表内真实领先点,但不应据此宣布全面超过 Fable 5/GPT-5.6 Sol。
最值得验证的数字是 token efficiency:Z.ai 说 GLM-5.3 在私有 Code Bench 上用更少输出 token 获得更高完成率;社区指出该数据尚无外部账单或公开任务可审计。
安全能力需分层理解:CyberGym 的白盒发现/验证成绩很强,但 ExploitBench 与 ExploitGym 仍明显落后;发现漏洞、构造可靠 exploit、证明生产可达性与安全修复不是同一能力。
作者没有公开运行 GLM-5.3 的输入、seed、工具 harness、硬件、时间预算或逐次结果。
所有表格数字来自 Z.ai 发布材料,属于厂商自报;社区作者明确写明尚无独立复现。
“约 744B MoE / 40B active”“1M context”“128K output”等规格也应以官方模型文档为准,不能由社区帖单独确认。
帖中把 ExploitGym 的 2 小时/6 小时任务数用于横向说明,但不同模型吞吐归一化和时间预算细节可能影响比较。
该帖的评论和价格信息会变化,本文只保留 2026-08-18 可见页面内容。
固定一个真实仓库,记录 commit、依赖、工具列表、上下文上限、effort 档位和时间预算。
先运行一个跨文件 bug 修复任务,要求模型先列计划,再修改、测试并给出 diff;保存所有工具调用与中间失败。
以同一提示和同一 harness 运行 GLM-5.3、GLM-5.2 与至少一个对照模型;不要只比较最终文本。
对每个模型重复多次,统计任务成功率、工具调用正确率、人工修正率、总延迟和“每个完成任务”的输入/输出/思考 token。
单独运行 JSON schema 校验、长链工具调用和安全代码审查三组任务;把发现漏洞、验证 exploit 与修复回归分别计分。
对照 Z.ai 发布表时标记哪些数字是 provider-reported,避免把复测结果和厂商表混在一起。
原帖正文提供 GLM-5.2→5.3 的 11 项对照数字,并写明“Every benchmark number above is vendor-reported”。
原帖列出 GLM-5.3 在 Terminal-Bench 3.0、DeepSWE、CyberGym、GDPval 等项目的对照分,并明确 ExploitBench/ExploitGym 仍落后闭源前沿。
原帖的复测建议包含仓库级任务、长链工具调用、严格 JSON schema、交付前人工修正率和 token per completed task 五类指标。
原帖引用的 Z.ai 原始资料:https://z.ai/blog/glm-5.3;本文以 Reddit 帖子作为分析来源,以 Z.ai 文章作为数据原始出处。
“Best open-weights model” and “best model” are two different claims, and only the first one holds up.
“Every benchmark number above is vendor-reported. Treat accordingly until third parties reproduce them.”
GLM-5.3