Z.AI 2026-04-07 官方材料称 GLM-5.1 可持续执行最多 8 小时,SWE-Bench Pro 58.4、KernelBench Level 3 几何平均加速 3.6×;结果依赖 OpenHands/Terminus/Claude Code 等 harness。
Z.ai · 查看证据GLM-5.1 · 测评与证据
GLM-5.1,哪些结论值得看?
按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。
这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。
编辑结论
编辑结论
Serenities AI 的 2026-03-29 评测区分早期 Claude Code 自报 45.3 与后续 SWE-Bench Pro 58.4,明确提醒两者不是同一测试;该页仍需按其配置阅读。
Serenities AI · 查看证据Artificial Analysis 2026-08-20 采集的 GLM-5.1 Reasoning 页面记录 Intelligence Index 41、吞吐 82.7 tokens/s,并提示输出偏长、价格偏高;这是平台聚合指数。
Artificial Analysis · 查看证据完整测评与相关内容
精选证据
GLM-5.1:Z.ai 官方长程工程基准与复现条件
Z.AI 2026-04-07 官方材料称 GLM-5.1 可持续执行最多 8 小时,SWE-Bench Pro 58.4、KernelBench Level 3 几何平均加速 3.6×;结果依赖 OpenHands/Terminus/Claude Code 等 harness。
待验证:本次未能重新核实原文。
- 条件
- 版本 GLM-5.1;官方发布 2026-04-07;任务为 SWE-Bench Pro、KernelBench L3 与 8 小时工程循环;harness、上下文管理和参数决定可比性。
GLM-5.1:Serenities AI 自报基准与独立验证边界
Serenities AI 的 2026-03-29 评测区分早期 Claude Code 自报 45.3 与后续 SWE-Bench Pro 58.4,明确提醒两者不是同一测试;该页仍需按其配置阅读。
待验证:本次未能重新核实原文。
- 条件
- 版本 GLM-5.1;Serenities AI 页面 2026-03-29,含 04-07/04-10 更新;样本/工具/基线按页面,45.3 与 58.4 不可合并。
GLM-5.1:Artificial Analysis 独立综合智能指数与推理吞吐测评
Artificial Analysis 2026-08-20 采集的 GLM-5.1 Reasoning 页面记录 Intelligence Index 41、吞吐 82.7 tokens/s,并提示输出偏长、价格偏高;这是平台聚合指数。
待验证:本次未能重新核实原文。
- 条件
- 版本 GLM-5.1 Reasoning;Artificial Analysis 采集 2026-08-20;指数含多项评测,完整题集、provider、重复和硬件未全部公开。
GLM-5.1:OpenCode 三模型工业网页实测与真实能力边界
Reddit OpenCode 单次工业运维看板生成比较中,GLM-5.1 视觉 UI 最佳、速度接近 DeepSeek V4 Pro,但需二次修复;Kubernetes YAML 与 100k+ 上下文出现格式/稳定性边界。
待验证:本次未能重新核实原文。
- 条件
- 版本 GLM-5.1;OpenCode 单次生成,来源 2026-05-15;任务为工业网页、Kubernetes YAML、100k+ 上下文;无统一重复和盲评。
全部来源
全部来源
GLM-5.1:Z.ai 官方长程工程基准与复现条件
Z.AI 2026-04-07 官方材料称 GLM-5.1 可持续执行最多 8 小时,SWE-Bench Pro 58.4、KernelBench Level 3 几何平均加速 3.6×;结果依赖 OpenHands/Terminus/Claude Code 等 harness。
待验证:本次未能重新核实原文。
- 条件
- 版本 GLM-5.1;官方发布 2026-04-07;任务为 SWE-Bench Pro、KernelBench L3 与 8 小时工程循环;harness、上下文管理和参数决定可比性。
GLM-5.1:Serenities AI 自报基准与独立验证边界
Serenities AI 的 2026-03-29 评测区分早期 Claude Code 自报 45.3 与后续 SWE-Bench Pro 58.4,明确提醒两者不是同一测试;该页仍需按其配置阅读。
待验证:本次未能重新核实原文。
- 条件
- 版本 GLM-5.1;Serenities AI 页面 2026-03-29,含 04-07/04-10 更新;样本/工具/基线按页面,45.3 与 58.4 不可合并。
GLM-5.1:Artificial Analysis 独立综合智能指数与推理吞吐测评
Artificial Analysis 2026-08-20 采集的 GLM-5.1 Reasoning 页面记录 Intelligence Index 41、吞吐 82.7 tokens/s,并提示输出偏长、价格偏高;这是平台聚合指数。
待验证:本次未能重新核实原文。
- 条件
- 版本 GLM-5.1 Reasoning;Artificial Analysis 采集 2026-08-20;指数含多项评测,完整题集、provider、重复和硬件未全部公开。
GLM-5.1:OpenCode 三模型工业网页实测与真实能力边界
Reddit OpenCode 单次工业运维看板生成比较中,GLM-5.1 视觉 UI 最佳、速度接近 DeepSeek V4 Pro,但需二次修复;Kubernetes YAML 与 100k+ 上下文出现格式/稳定性边界。
待验证:本次未能重新核实原文。
- 条件
- 版本 GLM-5.1;OpenCode 单次生成,来源 2026-05-15;任务为工业网页、Kubernetes YAML、100k+ 上下文;无统一重复和盲评。
GLM-5.1:Reddit LocalLLM 真实编码与上下文体验
社区体验把 GLM-5.1 描述为成本友好的 C++/日常编码和长程项目候选,但大型 monorepo、复杂调试、延迟和上下文稳定性仍有明显分歧,必须记录 provider 与 harness。
待验证:本次未能重新核实原文。
- 来源/版本
- GLM-5.1:Reddit LocalLLM 真实编码与上下文体验;动态状态按原文,本轮未重开
- 任务/样本
- personal-experience;任务、样本和重复以公开部分为准
- 环境/harness
- provider、客户端、参数与工具 harness 未统一公开