Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GLM-5.1 · 官方来源 · 厂商自报

GLM-5.1:Z.ai 官方长程工程基准与复现条件

Z.AI 2026-04-07 官方材料称 GLM-5.1 可持续执行最多 8 小时,SWE-Bench Pro 58.4、KernelBench Level 3 几何平均加速 3.6×;结果依赖 OpenHands/Terminus/Claude Code 等 harness。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

官方来源厂商自报编辑日期 2026-09-20

测试条件速查

条件
版本 GLM-5.1;官方发布 2026-04-07;任务为 SWE-Bench Pro、KernelBench L3 与 8 小时工程循环;harness、上下文管理和参数决定可比性。

关键数据与适用场景

一句话结论

官方数据把 GLM-5.1 的强项集中在长程代码优化和 Agent 工具循环,但分数高度依赖 OpenHands/Terminus/Claude Code 等 harness、上下文管理和特定参数,不能直接视作裸模型排名。

适用场景

  • 适合的任务:真实仓库工程、终端任务、代码安全、性能优化、长时间自主迭代。

  • 不适合的任务:把长程 coding 分数外推到通用推理、数学或另一套工具编排;HLE/GPQA/AIME 结果并不全面领先。

  • 适用的模型版本:GLM-5.1。

  • 适用的客户端、Agent 或 API:Z.ai API、OpenHands、Terminus-2、Claude Code 2.1.x;官方也提供本地 vLLM/SGLang 路径。

  • 推荐的推理档位和参数:按目标 benchmark 固定参数;不要把一个 harness 的 temperature/top_p/max_new_tokens 复制到另一个客户端而不重测。

测试环境、输入/配置

  • SWE-Bench Pro:OpenHands;temperature=1、top_p=0.95、max_new_tokens=32768、200K context。

  • NL2Repo:temperature=1.0、top_p=1.0、max_new_tokens=32768、200K context;规则预检和模型判断拦截恶意命令。

  • Terminal-Bench 2.0 Terminus-2:3 小时 timeout、temperature=1.0、top_p=1.0、max_new_tokens=8192、200K context;最多 16 CPU、32GB RAM。

  • Terminal-Bench Claude Code:Claude Code 2.1.69 think mode,temperature=1.0、top_p=0.95、max_new_tokens=131072,去除 wall-clock 限制,分数平均 5 次。

  • CyberGym:Claude Code 2.1.56 think mode,无 web tools;1,507 tasks,单次 Pass@1,单题 250 分钟 timeout。

  • MCP-Atlas:500-task public subset,think mode,单题 10 分钟 timeout,Gemini-3.0-Pro 作 judge。

  • 长程案例:VectorDBBench、KernelBench Level 3、Linux desktop web app;后者使用 harness 让模型每轮审查自身输出并继续改进。

结果数据

基准GLM-5.1GLM-5主要对照
HLE31.030.5Claude Opus 4.6 36.7;GPT-5.4 39.8
HLE w/ Tools52.350.4Claude 53.1;GPT-5.4 52.1
AIME 202695.395.4GPT-5.4 98.7
GPQA-Diamond86.286.0Claude 91.3;GPT-5.4 92.0
SWE-Bench Pro58.455.1GPT-5.4 57.7;Claude Opus 4.6 57.3;Gemini 54.2
NL2Repo42.735.9Claude 49.8;GPT-5.4 41.3
Terminal-Bench 2.0 Terminus-263.556.2Claude 65.4;Gemini 68.5
CyberGym68.748.3Claude 66.6;GPT-5.4 66.3
BrowseComp(无 context management)68.062.0—
BrowseComp(含 context management)79.375.9Claude 84.0;Gemini 85.9
MCP-Atlas Public71.869.2Claude 73.8;GPT-5.4 67.2

长程案例:VectorDBBench 超过 600 次优化迭代、6,000+ 工具调用,从约 3,547 到 21,500 QPS,Recall 约束为 ≥95%;KernelBench Level 3 最终几何平均约 3.6× speedup,Claude Opus 4.6 约 4.2×;Linux desktop web app 运行 8 小时持续加功能和修交互。

结论

GLM-5.1 相比 GLM-5 的提升最可信地体现在“继续工作更久”和“在有反馈的优化循环中仍能找到结构性改进”。SWE-Bench Pro 58.4、CyberGym 68.7、VectorDBBench 21.5k QPS支持工程 Agent 试用;数学/通用推理数据则显示它不是全面 frontier 第一。

局限

  • 这些是 Z.ai 自报结果,除非另有标注,无法视为独立受控测试;harness、judge、上下文裁剪和安全拒答都会影响分数。

  • 600 轮/8 小时案例是单个展示任务,完整 prompt、工具记录、失败样本和成本未全部公开。

  • Terminal-Bench 的 Terminus-2、Claude Code 和 best self-reported harness 分数不能互换比较。

  • HLE/GPT/Claude 等部分对照带星号,官方脚注明确其来源或评测条件不同;不要把表格当作完全同质实验。

复现步骤

  1. 固定模型版本、harness、工具、超时、上下文、参数和资源上限,并保存配置文件。

  2. 先跑公开的 SWE-Bench Pro/NL2Repo/Terminal-Bench 子集,保存 patch、测试、工具调用和每轮指标。

  3. 对 VectorDBBench/KernelBench 使用同样的反馈循环,明确约束、基线、提交频率和停止条件。

  4. 代码任务至少多次重复;记录 token、成本、失败/回退和结构性策略变更,不只记录最后分数。

  5. 用同一 harness 对照 GLM-5、Opus/GPT 等模型,分开报告纯推理、编码、工具和长程效率。

原始证据与数据

官方原文公开了 benchmark 表、每类任务的参数/资源、VectorDBBench/KernelBench/Linux desktop 三个长程场景,以及 58.4 SWE-Bench Pro、63.5 Terminus-2、68.7 CyberGym 等数字。

来源摘录或观察(仅做合规短引)

官方称 GLM-5.1 “stays productive over longer sessions”,但也承认长程优化仍面临局部最优、数千工具调用的连贯性和无指标任务的自评问题;这限定了结论的适用范围。

能支持的判断

  • 支持引用官方长时域定位与公开 benchmark 口径。

不能支持的判断

  • 不支持把官方结果当作裸模型排名或你的仓库成功率。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Z.ai · Z.ai 官方 · 原文发布日期 2026-04-07 · 本站编辑日期 2026-09-20

打开原始来源

GLM-5.1

在 Tabbit 中比较 GLM-5.1

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

GLM-5.1 是什么:长任务智能体、获取方式与价格

用可回溯来源说明 GLM-5.1 的 200K 上下文、8 小时执行主张、Z.AI 价格快照、部署边界与谨慎试用路径。

相关评测

GLM-5.1:Serenities AI 自报基准与独立验证边界Serenities AI 的 2026-03-29 评测区分早期 Claude Code 自报 45.3 与后续 SWE-Bench Pro 58.4,明确提醒两者不是同一测试;该页仍需按其配置阅读。GLM-5.1:Artificial Analysis 独立综合智能指数与推理吞吐测评Artificial Analysis 2026-08-20 采集的 GLM-5.1 Reasoning 页面记录 Intelligence Index 41、吞吐 82.7 tokens/s,并提示输出偏长、价格偏高;这是平台聚合指数。GLM-5.1:OpenCode 三模型工业网页实测与真实能力边界Reddit OpenCode 单次工业运维看板生成比较中,GLM-5.1 视觉 UI 最佳、速度接近 DeepSeek V4 Pro,但需二次修复;Kubernetes YAML 与 100k+ 上下文出现格式/稳定性边界。GLM-5.1:Reddit LocalLLM 真实编码与上下文体验社区体验把 GLM-5.1 描述为成本友好的 C++/日常编码和长程项目候选,但大型 monorepo、复杂调试、延迟和上下文稳定性仍有明显分歧,必须记录 provider 与 harness。GLM-5.1:长时域 Agent 与 Claude Code 配置GLM-5.1 应被当作“长时域工程 Agent”配置:给足上下文和输出预算,先明确角色/技术栈/验收,再让它循环执行、编译、测试和迭代;Claude Code 可直接把模型名切换为 `GLM-5.1`。GLM-5.1:SGLang 异构部署与 Interleaved Thinking 配置GLM-5.1 本地部署依赖精确的 `transformers==5.3.0` 与 SGLang 解析器配置,代码 Agent 工作流必须启用 `Interleaved + Preserved Thinking` 模式以防止多轮遗忘。GLM-5.1:Claude Code 工具发现与系统角色适配 Workaround在 Claude Code 或多 Agent 框架中使用 GLM-5.1 时,必须在系统提示词中显式注入 `tool_reference` 解析规则以防工具死锁,并拦截 `messages[]` 中的 `system` 角色以避免 HTTP 422 报错。GLM-5.1:OpenCode 多模型协同架构与防过度思考 Prompt将 GLM-5.1 作为“高性价比代码实体执行器”嵌入多模型流水线,并配合强制行动约束 Prompt,可有效化解模型在 Agent 中的过度思考死锁与 YAML 缩进格式缺陷。