BenchLM 收录了 GLM-5.3 的 17 条“原始来源可显示”跑分,但因缺少独立复测而不给综合分或排名,当前更适合把它当作可追溯的厂商数据账本,而不是独立排行榜。
适合的任务:核对 GLM-5.3 已公开的编码、Agent 与安全基准;快速查看每个数字的来源状态;制定等待权重开放后的复测清单。
不适合的任务:把页面分数当成独立测评、综合能力排名或真实项目成功率。
适用的模型版本:GLM-5.3(页面标注 2026-08-14 发布)。
适用的客户端、Agent 或 API:与客户端无关;数据来自 Z.AI 发布表,当前可通过 Coding Plan/ZCode 使用。
推荐的推理档位和参数:BenchLM 未执行调用,未公开参数;不能据此推断 low/high/max 的实际差异。
数据源:BenchLM 模型页;其方法论页面说明公开表默认只展示“exact-source rows”,排除生成或推测的跑分。
数据刷新时间:2026-08-17。
记录状态:GLM-5.3 有 17 条可显示基准记录;Agentic 与 Coding 类别各收录 8 条,另有 1 条 External signals;Reasoning、Knowledge、Math、Multilingual、Multimodal、Instruction Following 均标记为未测量。
独立性:页面明确将这些行标记为 Provider exact,原始链接均回指 Z.AI 发布文章;没有独立运行的输入、配置、seed 或逐次结果。
| 基准 | GLM-5.3 | 页面记录的最佳已核验对照 | 证据状态 |
|---|---|---|---|
| Terminal-Bench 2.1 | 88.2% | GLM-5.3 当前最佳已核验行 | Provider exact |
| Terminal-Bench 3.0 | 28.3% | GLM-5.3 当前最佳已核验行 | Provider exact |
| DeepSWE v1.1 | 66.9% | GPT-5.6 Sol 72.7%,落后 5.8 个百分点 | Provider exact |
| NL2Repo | 58.0% | DeepSeek V4 Pro 0813 61.5%,落后 3.5 个百分点 | Provider exact |
| ProgramBench | 19.0% | Claude Opus 5 93.0%,页面差距 74 个百分点 | Provider exact |
| FrontierSWE | 78.1% | Kimi K3 81.2%,落后 3.1 个百分点 | Provider exact |
| SWE-Marathon v1.1 | 42.5% | GLM-5.3 当前最佳已核验行 | Provider exact |
| PostTrainBench | 39.8% | GLM-5.3 当前最佳已核验行 | Provider exact |
| CyberGym | 84.5% | Fugu Cyber 86.9%,落后 2.4 个百分点 | Provider exact |
| ExploitGym | 页面归一化值 15.0% | GPT-5.6 Sol 33.7%,落后 18.7 个百分点 | Provider exact |
| Toolathlon-Verified | 73.0% | Claude Opus 5 80.6%,落后 7.6 个百分点 | Provider exact |
| AutomationBench | 48.2% | GLM-5.3 当前最佳已核验行 | Provider exact |
| Agents' Last Exam | 28.5% | Qwen3.8 Max 52.4%,落后 23.9 个百分点 | Provider exact |
| HLE with tools | 62.5% | Claude Opus 5 64.7%,落后 2.2 个百分点 | Provider exact |
| ExploitBench | 54.0% | Claude Mythos 5 78.0%,落后 23.6 个百分点 | Provider exact |
BenchLM 页面还列出 GDPval-AA v2 1769,但将其作为厂商来源记录而非独立验证分数;页面据此仍保持“Score pending / Not ranked”。
可确认的事实:GLM-5.3 的公开数字主要集中在终端编码、长程 Agent 和漏洞发现/利用相关测试;BenchLM 能把这些数字与 Z.AI 原文逐条关联。
不能确认的事实:这些分数能否在其他 harness、推理栈、预算、模型提供商或本地权重上复现;GLM-5.3 的综合能力排名;官方 token 效率声明是否转化为真实任务成本下降。
选型含义:GLM-5.3 在 BenchLM 的数据上更像“编码/Agent 证据充分、通用能力证据缺口明显”的模型。页面未测量多模态、数学、知识与指令遵循,因此不应把编码成绩外推为全能表现。
与厂商表的边界:BenchLM 的“best verified row”仅表示目录中目前可追溯的最高来源记录,不等于 BenchLM 重新跑出了该分数。
所有 GLM-5.3 行的证据状态均为 Provider exact,且原始链接指向 Z.AI;它不是独立受控测评。
页面没有公开 GLM-5.3 的请求输入、工具 schema、时间预算、采样参数、rollout 数、硬件或逐次结果。
ExploitGym 在目录中被归一化为 15.0%,而 Z.AI 发布表同时以 2 小时/6 小时完成任务数(105/130)呈现;两种表示不可直接等同,需查看 BenchLM 的归一化定义后再比较。
页面数据会随着模型目录更新而变化;本文只记录 2026-08-17 快照。
打开 https://benchlm.ai/models/glm-5-3,记录页面数据日期、17 条 source-displayable rows 与“Score pending / Not ranked”状态。
点击每条记录的 Z.AI 原始链接,核对 benchmark 名称、GLM-5.3 数字和对照表;不要把 Google 摘要或第三方转述当作结果。
打开 https://benchlm.ai/methodology,确认该目录只把 exact-source rows 纳入公开表,并检查数据刷新日期。
若要做真正独立复测,等待可下载权重或可计量 API 后,在固定仓库与工具 harness 下重复同一任务,记录输入、上下文、effort、时间预算、工具调用、每次成功/失败与 token per completed task。
BenchLM 模型页明确写出:GLM-5.3 有 17 条来源可显示的 benchmark rows,但没有公开 overall score 或 rank;页面类别分数均为 pending。
BenchLM 方法论明确写出:公开表默认只展示 exact-source rows,生成的 benchmark values 不进入证据表;数据集刷新日期为 2026-08-17。
GLM-5.3 的逐项原始来源链接回指 Z.AI 发布文章 https://z.ai/blog/glm-5.3;因此本文将 BenchLM 作为可追溯目录,而不是第二个独立跑分方。
“GLM-5.3 is tracked, but not publicly ranked yet.”
“Public BenchLM benchmark tables default to exact-source rows only.”
GLM-5.3