官方数据把 GLM-5.1 的强项集中在长程代码优化和 Agent 工具循环,但分数高度依赖 OpenHands/Terminus/Claude Code 等 harness、上下文管理和特定参数,不能直接视作裸模型排名。
适合的任务:真实仓库工程、终端任务、代码安全、性能优化、长时间自主迭代。
不适合的任务:把长程 coding 分数外推到通用推理、数学或另一套工具编排;HLE/GPQA/AIME 结果并不全面领先。
适用的模型版本:GLM-5.1。
适用的客户端、Agent 或 API:Z.ai API、OpenHands、Terminus-2、Claude Code 2.1.x;官方也提供本地 vLLM/SGLang 路径。
推荐的推理档位和参数:按目标 benchmark 固定参数;不要把一个 harness 的 temperature/top_p/max_new_tokens 复制到另一个客户端而不重测。
SWE-Bench Pro:OpenHands;temperature=1、top_p=0.95、max_new_tokens=32768、200K context。
NL2Repo:temperature=1.0、top_p=1.0、max_new_tokens=32768、200K context;规则预检和模型判断拦截恶意命令。
Terminal-Bench 2.0 Terminus-2:3 小时 timeout、temperature=1.0、top_p=1.0、max_new_tokens=8192、200K context;最多 16 CPU、32GB RAM。
Terminal-Bench Claude Code:Claude Code 2.1.69 think mode,temperature=1.0、top_p=0.95、max_new_tokens=131072,去除 wall-clock 限制,分数平均 5 次。
CyberGym:Claude Code 2.1.56 think mode,无 web tools;1,507 tasks,单次 Pass@1,单题 250 分钟 timeout。
MCP-Atlas:500-task public subset,think mode,单题 10 分钟 timeout,Gemini-3.0-Pro 作 judge。
长程案例:VectorDBBench、KernelBench Level 3、Linux desktop web app;后者使用 harness 让模型每轮审查自身输出并继续改进。
| 基准 | GLM-5.1 | GLM-5 | 主要对照 |
|---|---|---|---|
| HLE | 31.0 | 30.5 | Claude Opus 4.6 36.7;GPT-5.4 39.8 |
| HLE w/ Tools | 52.3 | 50.4 | Claude 53.1*;GPT-5.4 52.1* |
| AIME 2026 | 95.3 | 95.4 | GPT-5.4 98.7 |
| GPQA-Diamond | 86.2 | 86.0 | Claude 91.3;GPT-5.4 92.0 |
| SWE-Bench Pro | 58.4 | 55.1 | GPT-5.4 57.7;Claude Opus 4.6 57.3;Gemini 54.2 |
| NL2Repo | 42.7 | 35.9 | Claude 49.8;GPT-5.4 41.3 |
| Terminal-Bench 2.0 Terminus-2 | 63.5 | 56.2 | Claude 65.4;Gemini 68.5 |
| CyberGym | 68.7 | 48.3 | Claude 66.6;GPT-5.4 66.3 |
| BrowseComp(无 context management) | 68.0 | 62.0 | — |
| BrowseComp(含 context management) | 79.3 | 75.9 | Claude 84.0;Gemini 85.9 |
| MCP-Atlas Public | 71.8 | 69.2 | Claude 73.8;GPT-5.4 67.2 |
长程案例:VectorDBBench 超过 600 次优化迭代、6,000+ 工具调用,从约 3,547 到 21,500 QPS,Recall 约束为 ≥95%;KernelBench Level 3 最终几何平均约 3.6× speedup,Claude Opus 4.6 约 4.2×;Linux desktop web app 运行 8 小时持续加功能和修交互。
GLM-5.1 相比 GLM-5 的提升最可信地体现在“继续工作更久”和“在有反馈的优化循环中仍能找到结构性改进”。SWE-Bench Pro 58.4、CyberGym 68.7、VectorDBBench 21.5k QPS支持工程 Agent 试用;数学/通用推理数据则显示它不是全面 frontier 第一。
这些是 Z.ai 自报结果,除非另有标注,无法视为独立受控测试;harness、judge、上下文裁剪和安全拒答都会影响分数。
600 轮/8 小时案例是单个展示任务,完整 prompt、工具记录、失败样本和成本未全部公开。
Terminal-Bench 的 Terminus-2、Claude Code 和 best self-reported harness 分数不能互换比较。
HLE/GPT/Claude 等部分对照带星号,官方脚注明确其来源或评测条件不同;不要把表格当作完全同质实验。
固定模型版本、harness、工具、超时、上下文、参数和资源上限,并保存配置文件。
先跑公开的 SWE-Bench Pro/NL2Repo/Terminal-Bench 子集,保存 patch、测试、工具调用和每轮指标。
对 VectorDBBench/KernelBench 使用同样的反馈循环,明确约束、基线、提交频率和停止条件。
代码任务至少多次重复;记录 token、成本、失败/回退和结构性策略变更,不只记录最后分数。
用同一 harness 对照 GLM-5、Opus/GPT 等模型,分开报告纯推理、编码、工具和长程效率。
官方原文公开了 benchmark 表、每类任务的参数/资源、VectorDBBench/KernelBench/Linux desktop 三个长程场景,以及 58.4 SWE-Bench Pro、63.5 Terminus-2、68.7 CyberGym 等数字。
官方称 GLM-5.1 “stays productive over longer sessions”,但也承认长程优化仍面临局部最优、数千工具调用的连贯性和无指标任务的自评问题;这限定了结论的适用范围。
GLM-5.1