Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体GLM-5.1

GLM-5.1:Artificial Analysis 独立综合智能指数与推理吞吐测评

原始来源

Artificial Analysis

作者Artificial Analysis Research

原文日期2026-04-07

Tabbit 整理2026-08-20

查看原文

一句话结论

在第三方独立评测体系中,GLM-5.1 (Reasoning) 综合智能指数得分 41,吞吐达 82.7 tokens/s,位列同类模型前 20%,展现出高智能与高生成速度,但相对其他开源权重模型生成长度偏长且价格偏高。

适用场景

  • 适合的任务:对推理深度和吞吐速度有双重要求的智能体交互、复杂代码终端任务与结构化推理。

  • 不适合的任务:对单次输出 token 成本极度敏感、或追求极简短答的超高并发廉价场景。

  • 适用的模型版本:GLM-5.1 (Reasoning)。

  • 适用的客户端、Agent 或 API:第一方 Z.ai API 及 8 家主流第三方 API Provider。

  • 推荐的推理档位和参数:官方默认推理档位,建议开启 Prompt Caching(缓存折扣达 81%)。

测试环境、输入/配置

  • 评测框架版本:Artificial Analysis Intelligence Index v4.1.1。

  • 综合评估子集:共整合 9 项独立基准:

    1. GDPval-AA v2(真实世界工作任务)

    2. 𝜏³-Banking(工具调用与银行业务)

    3. Terminal-Bench v2.1(智能体编码与终端操作)

    4. SciCode(科学计算编码)

    5. Humanity's Last Exam (HLE)(前沿推理与知识)

    6. GPQA Diamond(科学逻辑推理)

    7. CritPt(物理学深度推理)

    8. AA-Omniscience(知识可靠性与非幻觉率)

    9. AA-LCR(长上下文推理)

  • 模型规格:总参数 744B,每 Token 激活参数 40B(MoE 架构),上下文窗口 200k tokens。

结果数据

评测维度GLM-5.1 (Reasoning)同类模型中位数同类排名 / 评级
Intelligence Index (综合智能指数)4127#19 / 107 (4/4 档)
生成速度 (Output Speed)82.7 tokens/s67.0 tokens/s#20 / 107 (3/4 档)
输入价格 (Input Price)$1.39 / 1M$0.30 / 1M偏高
输出价格 (Output Price)$4.40 / 1M$1.20 / 1M偏高
Prompt Cache 折扣81% ($0.30 / 1M)—优异
评测消耗 Token 总量 (Verbosity)120M tokens100M tokens偏详细 (Verbose)
单项任务加权成本$0.30 / task—#25 / 107 (3/4 档)

结论

Artificial Analysis 独立数据证实 GLM-5.1 在大模型综合梯队中处于上游前沿(分数为 41,远超中位数 27)。其 82.7 tps 的生成速度保证了在长程推理中具备良好的交互响应体验。然而其输出倾向上更偏向详细展开(120M tokens),且 API 定价在开源权重衍生模型中偏高,强烈建议生产部署中充分利用 Prompt Cache 机制降本。

局限

  • 该评测针对 Reasoning 模式的综合加权指标,非单一领域极限测试。

  • 价格数据基于评测时的官方标价与各 API Provider 中位数,实际费用随 Provider 变动。

  • 200k 上下文窗口满足绝大多数任务,但相比后续发布的 1M 窗口模型仍有长文本上限。

复现步骤

  1. 参考 Artificial Analysis 评测协议标准化输入提示词。

  2. 接入各 API 端点,统计首 Token 延迟(TTFT)与解码生成速度(tokens/s)。

  3. 运行 Terminal-Bench v2.1、SciCode 与 GPQA Diamond 子集,对比加权评分与输出 Token 长度。

  4. 对比开启与未开启 Prompt Caching 时的端到端 API 账单成本。

原始证据与数据

Artificial Analysis 官方页面公开记录了 GLM-5.1 的综合智能指数 41、输出速度 82.7 tokens/s、输入 $1.39/输出 $4.40 价格,以及 744B 总参数/40B 激活参数的 MoE 架构规格。

来源摘录或观察(仅做合规短引)

Artificial Analysis 总结指出:“GLM-5.1 (Reasoning) is amongst the leading models in intelligence, but particularly expensive when comparing to other open weight models of similar size. It's also faster than average, however somewhat verbose.”

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GLM-5.1

在 Tabbit 中使用并对比模型

GLM-5.1

相关测评

官方Z.ai2026-04-07

GLM-5.1:Z.ai 官方长程工程基准与复现条件

媒体Serenities AI2026-03-29

GLM-5.1:Serenities AI 自报基准与独立验证边界

社区Reddit r/LocalLLM

GLM-5.1:Reddit LocalLLM 真实编码与上下文体验

社区Reddit r/opencodeCLI2026-05-15

GLM-5.1:OpenCode 三模型工业网页实测与真实能力边界

GLM-5.1

相关提示词

官方Z.AI Developer Document / Z.ai2026-04-07

GLM-5.1:长时域 Agent 与 Claude Code 配置

社区GitHub kvcache-ai/ktransformers2026-04-08

GLM-5.1:SGLang 异构部署与 Interleaved Thinking 配置

社区GitHub zai-org/GLM-52026-05-28

GLM-5.1:Claude Code 工具发现与系统角色适配 Workaround

社区Reddit r/opencodeCLI & r/LocalLLM2026-05-15

GLM-5.1:OpenCode 多模型协同架构与防过度思考 Prompt