Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GLM-5.1 · 媒体来源 · 编辑分析

GLM-5.1:Serenities AI 自报基准与独立验证边界

Serenities AI 的 2026-03-29 评测区分早期 Claude Code 自报 45.3 与后续 SWE-Bench Pro 58.4,明确提醒两者不是同一测试;该页仍需按其配置阅读。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源编辑分析编辑日期 2026-09-20

测试条件速查

条件
版本 GLM-5.1;Serenities AI 页面 2026-03-29,含 04-07/04-10 更新;样本/工具/基线按页面,45.3 与 58.4 不可合并。

关键数据与适用场景

一句话结论

这篇完整评测最有价值的不是“94.6% of Opus”标题,而是把早期 45.3 分的 Claude Code 自报结果与后续 58.4 SWE-Bench Pro 更新区分开,并明确提醒二者不能当作同一测试。

适用场景

  • 适合的任务:评估 GLM-5.1 的编码定位、价格/开源部署意义以及需要等待独立验证的风险清单。

  • 不适合的任务:用早期 45.3 或后续 58.4 单一数字直接决定生产替换;文章本身说明早期结果缺少完整方法细节。

  • 适用的模型版本:GLM-5.1 发布初期和 2026-04 更新资料。

  • 适用的客户端、Agent 或 API:Claude Code harness、Z.ai API、Cline 等;文章未公开可重复的统一调用配置。

  • 推荐的推理档位和参数:未公开/无法核实;应以 Z.ai 官方当前 benchmark/文档为准。

测试环境、输入/配置

  • 早期编码分数使用 Claude Code 作为评估框架:GLM-5.1 45.3,GLM-5 35.4,Claude Opus 4.6 47.9。

  • 文章明确指出早期评测没有完整披露评分方法,且使用 Claude Code harness,不能与其他 benchmark 直接横比。

  • 2026-04 更新部分引用 Z.ai 新的 SWE-Bench Pro 58.4、CyberGym 68.7、Terminal-Bench 63.5、NL2Repo 42.7 等结果;其参数和资源条件以 Z.ai 官方页为准。

结果数据

早期 Claude Code coding score

模型Coding score相对 Opus 4.6
Claude Opus 4.647.9100%
GLM-5.145.394.6%
GLM-535.473.9%

文章更新时引用的公开基准

基准GLM-5.1GPT-5.4Claude Opus 4.6
SWE-Bench Pro58.457.757.3
CyberGym68.7未公开66.6
Terminal-Bench 2.063.5(Claude Code scaffold 另报 66.5)未公开未公开
HLE31.039.836.7
GPQA-Diamond86.292.091.3
AIME 202695.398.7未公开
NL2Repo42.7未公开未公开

结论

Serenities AI 的证据支持三点:GLM-5.1 的工程/编码方向值得关注;早期 45.3 结果是 Z.ai 自报且 harness 依赖强;后续 58.4 等数字代表另一套更新评估。文章还指出 GLM 在成本、MIT 开源和数据主权上有现实价值,但通用推理和复杂大型代码库仍需实测。

局限

  • 文章大量内容是新闻式二次整理,不能代替原始 benchmark。

  • 早期 45.3 与后续 58.4 来自不同评估设置/时间点,不能计算成“模型提升百分比”。

  • 文中关于 IPO、硬件、价格和部分独立验证的背景信息与模型质量无直接因果关系,应分开核实。

  • 文章没有公开完整 prompt、工具 schema、重复次数和原始输出;类别为 comparison 而非 reproducible-test。

复现步骤

  1. 将早期 Claude Code score 与当前 SWE-Bench Pro 作为两个独立实验,不混用数据。

  2. 直接按 Z.ai 官方 footnote 复刻当前公开 benchmark 参数,再记录版本/日期。

  3. 对真实项目选择小修复、中型重构、调试和大仓库任务,固定 harness 与验收标准做 A/B。

  4. 同时记录 token 成本、延迟、上下文丢失、工具错误和人工修正,避免用单一分数替代生产证据。

原始证据与数据

文章完整给出早期 45.3/47.9/35.4 表格,并在更新段落给出 58.4 SWE-Bench Pro 与其他基准,同时明确早期数字“entirely self-reported by Z.ai”且等待第三方复核。

来源摘录或观察(仅做合规短引)

评测的核心警告是 “Treat the 94.6% figure as a promising preliminary claim, not an established fact”;这比把标题数字当成结论更适合作为资料边界。

能支持的判断

  • 支持区分自报结果与后续 benchmark 更新。

不能支持的判断

  • 不支持把两个数字当连续复跑或独立验证。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Serenities AI · Serenities AI · 原文发布日期 2026-03-29 · 本站编辑日期 2026-09-20

打开原始来源

GLM-5.1

在 Tabbit 中比较 GLM-5.1

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

GLM-5.1 是什么:长任务智能体、获取方式与价格

用可回溯来源说明 GLM-5.1 的 200K 上下文、8 小时执行主张、Z.AI 价格快照、部署边界与谨慎试用路径。

相关评测

GLM-5.1:Artificial Analysis 独立综合智能指数与推理吞吐测评Artificial Analysis 2026-08-20 采集的 GLM-5.1 Reasoning 页面记录 Intelligence Index 41、吞吐 82.7 tokens/s,并提示输出偏长、价格偏高;这是平台聚合指数。GLM-5.1:Z.ai 官方长程工程基准与复现条件Z.AI 2026-04-07 官方材料称 GLM-5.1 可持续执行最多 8 小时,SWE-Bench Pro 58.4、KernelBench Level 3 几何平均加速 3.6×;结果依赖 OpenHands/Terminus/Claude Code 等 harness。GLM-5.1:OpenCode 三模型工业网页实测与真实能力边界Reddit OpenCode 单次工业运维看板生成比较中,GLM-5.1 视觉 UI 最佳、速度接近 DeepSeek V4 Pro,但需二次修复;Kubernetes YAML 与 100k+ 上下文出现格式/稳定性边界。GLM-5.1:Reddit LocalLLM 真实编码与上下文体验社区体验把 GLM-5.1 描述为成本友好的 C++/日常编码和长程项目候选,但大型 monorepo、复杂调试、延迟和上下文稳定性仍有明显分歧,必须记录 provider 与 harness。GLM-5.1:长时域 Agent 与 Claude Code 配置GLM-5.1 应被当作“长时域工程 Agent”配置:给足上下文和输出预算,先明确角色/技术栈/验收,再让它循环执行、编译、测试和迭代;Claude Code 可直接把模型名切换为 `GLM-5.1`。GLM-5.1:SGLang 异构部署与 Interleaved Thinking 配置GLM-5.1 本地部署依赖精确的 `transformers==5.3.0` 与 SGLang 解析器配置,代码 Agent 工作流必须启用 `Interleaved + Preserved Thinking` 模式以防止多轮遗忘。GLM-5.1:Claude Code 工具发现与系统角色适配 Workaround在 Claude Code 或多 Agent 框架中使用 GLM-5.1 时,必须在系统提示词中显式注入 `tool_reference` 解析规则以防工具死锁,并拦截 `messages[]` 中的 `system` 角色以避免 HTTP 422 报错。GLM-5.1:OpenCode 多模型协同架构与防过度思考 Prompt将 GLM-5.1 作为“高性价比代码实体执行器”嵌入多模型流水线,并配合强制行动约束 Prompt,可有效化解模型在 Agent 中的过度思考死锁与 YAML 缩进格式缺陷。