Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GLM-5.1 · 媒体来源 · 编辑分析

GLM-5.1:Artificial Analysis 独立综合智能指数与推理吞吐测评

Artificial Analysis 2026-08-20 采集的 GLM-5.1 Reasoning 页面记录 Intelligence Index 41、吞吐 82.7 tokens/s,并提示输出偏长、价格偏高;这是平台聚合指数。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源编辑分析编辑日期 2026-09-20

测试条件速查

条件
版本 GLM-5.1 Reasoning;Artificial Analysis 采集 2026-08-20;指数含多项评测,完整题集、provider、重复和硬件未全部公开。

关键数据与适用场景

一句话结论

在第三方独立评测体系中,GLM-5.1 (Reasoning) 综合智能指数得分 41,吞吐达 82.7 tokens/s,位列同类模型前 20%,展现出高智能与高生成速度,但相对其他开源权重模型生成长度偏长且价格偏高。

适用场景

  • 适合的任务:对推理深度和吞吐速度有双重要求的智能体交互、复杂代码终端任务与结构化推理。

  • 不适合的任务:对单次输出 token 成本极度敏感、或追求极简短答的超高并发廉价场景。

  • 适用的模型版本:GLM-5.1 (Reasoning)。

  • 适用的客户端、Agent 或 API:第一方 Z.ai API 及 8 家主流第三方 API Provider。

  • 推荐的推理档位和参数:官方默认推理档位,建议开启 Prompt Caching(缓存折扣达 81%)。

测试环境、输入/配置

  • 评测框架版本:Artificial Analysis Intelligence Index v4.1.1。

  • 综合评估子集:共整合 9 项独立基准:

    1. GDPval-AA v2(真实世界工作任务)

    2. 𝜏³-Banking(工具调用与银行业务)

    3. Terminal-Bench v2.1(智能体编码与终端操作)

    4. SciCode(科学计算编码)

    5. Humanity's Last Exam (HLE)(前沿推理与知识)

    6. GPQA Diamond(科学逻辑推理)

    7. CritPt(物理学深度推理)

    8. AA-Omniscience(知识可靠性与非幻觉率)

    9. AA-LCR(长上下文推理)

  • 模型规格:总参数 744B,每 Token 激活参数 40B(MoE 架构),上下文窗口 200k tokens。

结果数据

评测维度GLM-5.1 (Reasoning)同类模型中位数同类排名 / 评级
Intelligence Index (综合智能指数)4127#19 / 107 (4/4 档)
生成速度 (Output Speed)82.7 tokens/s67.0 tokens/s#20 / 107 (3/4 档)
输入价格 (Input Price)$1.39 / 1M$0.30 / 1M偏高
输出价格 (Output Price)$4.40 / 1M$1.20 / 1M偏高
Prompt Cache 折扣81% ($0.30 / 1M)—优异
评测消耗 Token 总量 (Verbosity)120M tokens100M tokens偏详细 (Verbose)
单项任务加权成本$0.30 / task—#25 / 107 (3/4 档)

结论

Artificial Analysis 独立数据证实 GLM-5.1 在大模型综合梯队中处于上游前沿(分数为 41,远超中位数 27)。其 82.7 tps 的生成速度保证了在长程推理中具备良好的交互响应体验。然而其输出倾向上更偏向详细展开(120M tokens),且 API 定价在开源权重衍生模型中偏高,强烈建议生产部署中充分利用 Prompt Cache 机制降本。

局限

  • 该评测针对 Reasoning 模式的综合加权指标,非单一领域极限测试。

  • 价格数据基于评测时的官方标价与各 API Provider 中位数,实际费用随 Provider 变动。

  • 200k 上下文窗口满足绝大多数任务,但相比后续发布的 1M 窗口模型仍有长文本上限。

复现步骤

  1. 参考 Artificial Analysis 评测协议标准化输入提示词。

  2. 接入各 API 端点,统计首 Token 延迟(TTFT)与解码生成速度(tokens/s)。

  3. 运行 Terminal-Bench v2.1、SciCode 与 GPQA Diamond 子集,对比加权评分与输出 Token 长度。

  4. 对比开启与未开启 Prompt Caching 时的端到端 API 账单成本。

原始证据与数据

Artificial Analysis 官方页面公开记录了 GLM-5.1 的综合智能指数 41、输出速度 82.7 tokens/s、输入 $1.39/输出 $4.40 价格,以及 744B 总参数/40B 激活参数的 MoE 架构规格。

来源摘录或观察(仅做合规短引)

Artificial Analysis 总结指出:“GLM-5.1 (Reasoning) is amongst the leading models in intelligence, but particularly expensive when comparing to other open weight models of similar size. It's also faster than average, however somewhat verbose.”

能支持的判断

  • 支持在 AA 方法内对照智能指数、吞吐和冗长度量。

不能支持的判断

  • 不支持把聚合指数解释为固定 provider 或生产成本。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Artificial Analysis · Artificial Analysis Research · 原文发布日期 2026-04-07 · 本站编辑日期 2026-09-20

打开原始来源

GLM-5.1

在 Tabbit 中比较 GLM-5.1

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

GLM-5.1 是什么:长任务智能体、获取方式与价格

用可回溯来源说明 GLM-5.1 的 200K 上下文、8 小时执行主张、Z.AI 价格快照、部署边界与谨慎试用路径。

相关评测

GLM-5.1:Serenities AI 自报基准与独立验证边界Serenities AI 的 2026-03-29 评测区分早期 Claude Code 自报 45.3 与后续 SWE-Bench Pro 58.4,明确提醒两者不是同一测试;该页仍需按其配置阅读。GLM-5.1:Z.ai 官方长程工程基准与复现条件Z.AI 2026-04-07 官方材料称 GLM-5.1 可持续执行最多 8 小时,SWE-Bench Pro 58.4、KernelBench Level 3 几何平均加速 3.6×;结果依赖 OpenHands/Terminus/Claude Code 等 harness。GLM-5.1:OpenCode 三模型工业网页实测与真实能力边界Reddit OpenCode 单次工业运维看板生成比较中,GLM-5.1 视觉 UI 最佳、速度接近 DeepSeek V4 Pro,但需二次修复;Kubernetes YAML 与 100k+ 上下文出现格式/稳定性边界。GLM-5.1:Reddit LocalLLM 真实编码与上下文体验社区体验把 GLM-5.1 描述为成本友好的 C++/日常编码和长程项目候选,但大型 monorepo、复杂调试、延迟和上下文稳定性仍有明显分歧,必须记录 provider 与 harness。GLM-5.1:长时域 Agent 与 Claude Code 配置GLM-5.1 应被当作“长时域工程 Agent”配置:给足上下文和输出预算,先明确角色/技术栈/验收,再让它循环执行、编译、测试和迭代;Claude Code 可直接把模型名切换为 `GLM-5.1`。GLM-5.1:SGLang 异构部署与 Interleaved Thinking 配置GLM-5.1 本地部署依赖精确的 `transformers==5.3.0` 与 SGLang 解析器配置,代码 Agent 工作流必须启用 `Interleaved + Preserved Thinking` 模式以防止多轮遗忘。GLM-5.1:Claude Code 工具发现与系统角色适配 Workaround在 Claude Code 或多 Agent 框架中使用 GLM-5.1 时,必须在系统提示词中显式注入 `tool_reference` 解析规则以防工具死锁,并拦截 `messages[]` 中的 `system` 角色以避免 HTTP 422 报错。GLM-5.1:OpenCode 多模型协同架构与防过度思考 Prompt将 GLM-5.1 作为“高性价比代码实体执行器”嵌入多模型流水线,并配合强制行动约束 Prompt,可有效化解模型在 Agent 中的过度思考死锁与 YAML 缩进格式缺陷。