GLM-5.1

GLM-5.1 · 测评与证据

GLM-5.1,哪些结论值得看?

按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。

这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。

编辑结论

编辑结论

Z.AI 2026-04-07 官方材料称 GLM-5.1 可持续执行最多 8 小时,SWE-Bench Pro 58.4、KernelBench Level 3 几何平均加速 3.6×;结果依赖 OpenHands/Terminus/Claude Code 等 harness。

Z.ai · 查看证据

Serenities AI 的 2026-03-29 评测区分早期 Claude Code 自报 45.3 与后续 SWE-Bench Pro 58.4,明确提醒两者不是同一测试;该页仍需按其配置阅读。

Serenities AI · 查看证据

Artificial Analysis 2026-08-20 采集的 GLM-5.1 Reasoning 页面记录 Intelligence Index 41、吞吐 82.7 tokens/s,并提示输出偏长、价格偏高;这是平台聚合指数。

Artificial Analysis · 查看证据

完整测评与相关内容

模型深度阅读

总览 · 简体中文

GLM-5.1 是什么:长任务智能体、获取方式与价格

用可回溯来源说明 GLM-5.1 的 200K 上下文、8 小时执行主张、Z.AI 价格快照、部署边界与谨慎试用路径。

精选证据

官方厂商自报

GLM-5.1:Z.ai 官方长程工程基准与复现条件

Z.AI 2026-04-07 官方材料称 GLM-5.1 可持续执行最多 8 小时,SWE-Bench Pro 58.4、KernelBench Level 3 几何平均加速 3.6×;结果依赖 OpenHands/Terminus/Claude Code 等 harness。

来源Z.ai
原文日期2026-04-07
采集2026-08-20

待验证:本次未能重新核实原文。

条件
版本 GLM-5.1;官方发布 2026-04-07;任务为 SWE-Bench Pro、KernelBench L3 与 8 小时工程循环;harness、上下文管理和参数决定可比性。
推理能力
媒体 / 基准方编辑分析

GLM-5.1:Serenities AI 自报基准与独立验证边界

Serenities AI 的 2026-03-29 评测区分早期 Claude Code 自报 45.3 与后续 SWE-Bench Pro 58.4,明确提醒两者不是同一测试;该页仍需按其配置阅读。

来源Serenities AI
原文日期2026-03-29
采集2026-08-20

待验证:本次未能重新核实原文。

条件
版本 GLM-5.1;Serenities AI 页面 2026-03-29,含 04-07/04-10 更新;样本/工具/基线按页面,45.3 与 58.4 不可合并。
推理能力
媒体 / 基准方编辑分析

GLM-5.1:Artificial Analysis 独立综合智能指数与推理吞吐测评

Artificial Analysis 2026-08-20 采集的 GLM-5.1 Reasoning 页面记录 Intelligence Index 41、吞吐 82.7 tokens/s,并提示输出偏长、价格偏高;这是平台聚合指数。

来源Artificial Analysis
原文日期2026-04-07
采集2026-08-20

待验证:本次未能重新核实原文。

条件
版本 GLM-5.1 Reasoning;Artificial Analysis 采集 2026-08-20;指数含多项评测,完整题集、provider、重复和硬件未全部公开。
推理能力
社区个人体验

GLM-5.1:OpenCode 三模型工业网页实测与真实能力边界

Reddit OpenCode 单次工业运维看板生成比较中,GLM-5.1 视觉 UI 最佳、速度接近 DeepSeek V4 Pro,但需二次修复;Kubernetes YAML 与 100k+ 上下文出现格式/稳定性边界。

来源Reddit r/opencodeCLI
原文日期2026-05-15
采集2026-08-20

待验证:本次未能重新核实原文。

条件
版本 GLM-5.1;OpenCode 单次生成,来源 2026-05-15;任务为工业网页、Kubernetes YAML、100k+ 上下文;无统一重复和盲评。
推理能力

全部来源

全部来源

5 / 5
官方厂商自报

GLM-5.1:Z.ai 官方长程工程基准与复现条件

Z.AI 2026-04-07 官方材料称 GLM-5.1 可持续执行最多 8 小时,SWE-Bench Pro 58.4、KernelBench Level 3 几何平均加速 3.6×;结果依赖 OpenHands/Terminus/Claude Code 等 harness。

来源Z.ai
原文日期2026-04-07
采集2026-08-20

待验证:本次未能重新核实原文。

条件
版本 GLM-5.1;官方发布 2026-04-07;任务为 SWE-Bench Pro、KernelBench L3 与 8 小时工程循环;harness、上下文管理和参数决定可比性。
推理能力
媒体 / 基准方编辑分析

GLM-5.1:Serenities AI 自报基准与独立验证边界

Serenities AI 的 2026-03-29 评测区分早期 Claude Code 自报 45.3 与后续 SWE-Bench Pro 58.4,明确提醒两者不是同一测试;该页仍需按其配置阅读。

来源Serenities AI
原文日期2026-03-29
采集2026-08-20

待验证:本次未能重新核实原文。

条件
版本 GLM-5.1;Serenities AI 页面 2026-03-29,含 04-07/04-10 更新;样本/工具/基线按页面,45.3 与 58.4 不可合并。
推理能力
媒体 / 基准方编辑分析

GLM-5.1:Artificial Analysis 独立综合智能指数与推理吞吐测评

Artificial Analysis 2026-08-20 采集的 GLM-5.1 Reasoning 页面记录 Intelligence Index 41、吞吐 82.7 tokens/s,并提示输出偏长、价格偏高;这是平台聚合指数。

来源Artificial Analysis
原文日期2026-04-07
采集2026-08-20

待验证:本次未能重新核实原文。

条件
版本 GLM-5.1 Reasoning;Artificial Analysis 采集 2026-08-20;指数含多项评测,完整题集、provider、重复和硬件未全部公开。
推理能力
社区个人体验

GLM-5.1:OpenCode 三模型工业网页实测与真实能力边界

Reddit OpenCode 单次工业运维看板生成比较中,GLM-5.1 视觉 UI 最佳、速度接近 DeepSeek V4 Pro,但需二次修复;Kubernetes YAML 与 100k+ 上下文出现格式/稳定性边界。

来源Reddit r/opencodeCLI
原文日期2026-05-15
采集2026-08-20

待验证:本次未能重新核实原文。

条件
版本 GLM-5.1;OpenCode 单次生成,来源 2026-05-15;任务为工业网页、Kubernetes YAML、100k+ 上下文;无统一重复和盲评。
推理能力
社区个人体验

GLM-5.1:Reddit LocalLLM 真实编码与上下文体验

社区体验把 GLM-5.1 描述为成本友好的 C++/日常编码和长程项目候选,但大型 monorepo、复杂调试、延迟和上下文稳定性仍有明显分歧,必须记录 provider 与 harness。

来源Reddit r/LocalLLM
原文日期未知
采集2026-08-20

待验证:本次未能重新核实原文。

来源/版本
GLM-5.1:Reddit LocalLLM 真实编码与上下文体验;动态状态按原文,本轮未重开
任务/样本
personal-experience;任务、样本和重复以公开部分为准
环境/harness
provider、客户端、参数与工具 harness 未统一公开
推理能力

GLM-5.1

在 Tabbit 中比较 GLM-5.1

客户端中的模型、功能和权限以当前账户为准。