这篇完整评测最有价值的不是“94.6% of Opus”标题,而是把早期 45.3 分的 Claude Code 自报结果与后续 58.4 SWE-Bench Pro 更新区分开,并明确提醒二者不能当作同一测试。
适合的任务:评估 GLM-5.1 的编码定位、价格/开源部署意义以及需要等待独立验证的风险清单。
不适合的任务:用早期 45.3 或后续 58.4 单一数字直接决定生产替换;文章本身说明早期结果缺少完整方法细节。
适用的模型版本:GLM-5.1 发布初期和 2026-04 更新资料。
适用的客户端、Agent 或 API:Claude Code harness、Z.ai API、Cline 等;文章未公开可重复的统一调用配置。
推荐的推理档位和参数:未公开/无法核实;应以 Z.ai 官方当前 benchmark/文档为准。
早期编码分数使用 Claude Code 作为评估框架:GLM-5.1 45.3,GLM-5 35.4,Claude Opus 4.6 47.9。
文章明确指出早期评测没有完整披露评分方法,且使用 Claude Code harness,不能与其他 benchmark 直接横比。
2026-04 更新部分引用 Z.ai 新的 SWE-Bench Pro 58.4、CyberGym 68.7、Terminal-Bench 63.5、NL2Repo 42.7 等结果;其参数和资源条件以 Z.ai 官方页为准。
| 模型 | Coding score | 相对 Opus 4.6 |
|---|---|---|
| Claude Opus 4.6 | 47.9 | 100% |
| GLM-5.1 | 45.3 | 94.6% |
| GLM-5 | 35.4 | 73.9% |
| 基准 | GLM-5.1 | GPT-5.4 | Claude Opus 4.6 |
|---|---|---|---|
| SWE-Bench Pro | 58.4 | 57.7 | 57.3 |
| CyberGym | 68.7 | 未公开 | 66.6 |
| Terminal-Bench 2.0 | 63.5(Claude Code scaffold 另报 66.5) | 未公开 | 未公开 |
| HLE | 31.0 | 39.8 | 36.7 |
| GPQA-Diamond | 86.2 | 92.0 | 91.3 |
| AIME 2026 | 95.3 | 98.7 | 未公开 |
| NL2Repo | 42.7 | 未公开 | 未公开 |
Serenities AI 的证据支持三点:GLM-5.1 的工程/编码方向值得关注;早期 45.3 结果是 Z.ai 自报且 harness 依赖强;后续 58.4 等数字代表另一套更新评估。文章还指出 GLM 在成本、MIT 开源和数据主权上有现实价值,但通用推理和复杂大型代码库仍需实测。
文章大量内容是新闻式二次整理,不能代替原始 benchmark。
早期 45.3 与后续 58.4 来自不同评估设置/时间点,不能计算成“模型提升百分比”。
文中关于 IPO、硬件、价格和部分独立验证的背景信息与模型质量无直接因果关系,应分开核实。
文章没有公开完整 prompt、工具 schema、重复次数和原始输出;类别为 comparison 而非 reproducible-test。
将早期 Claude Code score 与当前 SWE-Bench Pro 作为两个独立实验,不混用数据。
直接按 Z.ai 官方 footnote 复刻当前公开 benchmark 参数,再记录版本/日期。
对真实项目选择小修复、中型重构、调试和大仓库任务,固定 harness 与验收标准做 A/B。
同时记录 token 成本、延迟、上下文丢失、工具错误和人工修正,避免用单一分数替代生产证据。
文章完整给出早期 45.3/47.9/35.4 表格,并在更新段落给出 58.4 SWE-Bench Pro 与其他基准,同时明确早期数字“entirely self-reported by Z.ai”且等待第三方复核。
评测的核心警告是 “Treat the 94.6% figure as a promising preliminary claim, not an established fact”;这比把标题数字当成结论更适合作为资料边界。
GLM-5.1