Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体GLM-5.3

GLM-5.3:BenchLM 源可核验基准账本与“不排名”结论

原始来源

BenchLM(第三方模型基准目录)

作者BenchLM 编辑/数据团队(署名未公开)

原文日期2026-08-17

Tabbit 整理2026-08-19

查看原文

一句话结论

BenchLM 收录了 GLM-5.3 的 17 条“原始来源可显示”跑分,但因缺少独立复测而不给综合分或排名,当前更适合把它当作可追溯的厂商数据账本,而不是独立排行榜。

适用场景

  • 适合的任务:核对 GLM-5.3 已公开的编码、Agent 与安全基准;快速查看每个数字的来源状态;制定等待权重开放后的复测清单。

  • 不适合的任务:把页面分数当成独立测评、综合能力排名或真实项目成功率。

  • 适用的模型版本:GLM-5.3(页面标注 2026-08-14 发布)。

  • 适用的客户端、Agent 或 API:与客户端无关;数据来自 Z.AI 发布表,当前可通过 Coding Plan/ZCode 使用。

  • 推荐的推理档位和参数:BenchLM 未执行调用,未公开参数;不能据此推断 low/high/max 的实际差异。

测试环境

  • 数据源:BenchLM 模型页;其方法论页面说明公开表默认只展示“exact-source rows”,排除生成或推测的跑分。

  • 数据刷新时间:2026-08-17。

  • 记录状态:GLM-5.3 有 17 条可显示基准记录;Agentic 与 Coding 类别各收录 8 条,另有 1 条 External signals;Reasoning、Knowledge、Math、Multilingual、Multimodal、Instruction Following 均标记为未测量。

  • 独立性:页面明确将这些行标记为 Provider exact,原始链接均回指 Z.AI 发布文章;没有独立运行的输入、配置、seed 或逐次结果。

结果数据

Coding / Agentic

基准GLM-5.3页面记录的最佳已核验对照证据状态
Terminal-Bench 2.188.2%GLM-5.3 当前最佳已核验行Provider exact
Terminal-Bench 3.028.3%GLM-5.3 当前最佳已核验行Provider exact
DeepSWE v1.166.9%GPT-5.6 Sol 72.7%,落后 5.8 个百分点Provider exact
NL2Repo58.0%DeepSeek V4 Pro 0813 61.5%,落后 3.5 个百分点Provider exact
ProgramBench19.0%Claude Opus 5 93.0%,页面差距 74 个百分点Provider exact
FrontierSWE78.1%Kimi K3 81.2%,落后 3.1 个百分点Provider exact
SWE-Marathon v1.142.5%GLM-5.3 当前最佳已核验行Provider exact
PostTrainBench39.8%GLM-5.3 当前最佳已核验行Provider exact
CyberGym84.5%Fugu Cyber 86.9%,落后 2.4 个百分点Provider exact
ExploitGym页面归一化值 15.0%GPT-5.6 Sol 33.7%,落后 18.7 个百分点Provider exact
Toolathlon-Verified73.0%Claude Opus 5 80.6%,落后 7.6 个百分点Provider exact
AutomationBench48.2%GLM-5.3 当前最佳已核验行Provider exact
Agents' Last Exam28.5%Qwen3.8 Max 52.4%,落后 23.9 个百分点Provider exact
HLE with tools62.5%Claude Opus 5 64.7%,落后 2.2 个百分点Provider exact
ExploitBench54.0%Claude Mythos 5 78.0%,落后 23.6 个百分点Provider exact

BenchLM 页面还列出 GDPval-AA v2 1769,但将其作为厂商来源记录而非独立验证分数;页面据此仍保持“Score pending / Not ranked”。

结论

  1. 可确认的事实:GLM-5.3 的公开数字主要集中在终端编码、长程 Agent 和漏洞发现/利用相关测试;BenchLM 能把这些数字与 Z.AI 原文逐条关联。

  2. 不能确认的事实:这些分数能否在其他 harness、推理栈、预算、模型提供商或本地权重上复现;GLM-5.3 的综合能力排名;官方 token 效率声明是否转化为真实任务成本下降。

  3. 选型含义:GLM-5.3 在 BenchLM 的数据上更像“编码/Agent 证据充分、通用能力证据缺口明显”的模型。页面未测量多模态、数学、知识与指令遵循,因此不应把编码成绩外推为全能表现。

  4. 与厂商表的边界:BenchLM 的“best verified row”仅表示目录中目前可追溯的最高来源记录,不等于 BenchLM 重新跑出了该分数。

局限

  • 所有 GLM-5.3 行的证据状态均为 Provider exact,且原始链接指向 Z.AI;它不是独立受控测评。

  • 页面没有公开 GLM-5.3 的请求输入、工具 schema、时间预算、采样参数、rollout 数、硬件或逐次结果。

  • ExploitGym 在目录中被归一化为 15.0%,而 Z.AI 发布表同时以 2 小时/6 小时完成任务数(105/130)呈现;两种表示不可直接等同,需查看 BenchLM 的归一化定义后再比较。

  • 页面数据会随着模型目录更新而变化;本文只记录 2026-08-17 快照。

复现步骤

  1. 打开 https://benchlm.ai/models/glm-5-3,记录页面数据日期、17 条 source-displayable rows 与“Score pending / Not ranked”状态。

  2. 点击每条记录的 Z.AI 原始链接,核对 benchmark 名称、GLM-5.3 数字和对照表;不要把 Google 摘要或第三方转述当作结果。

  3. 打开 https://benchlm.ai/methodology,确认该目录只把 exact-source rows 纳入公开表,并检查数据刷新日期。

  4. 若要做真正独立复测,等待可下载权重或可计量 API 后,在固定仓库与工具 harness 下重复同一任务,记录输入、上下文、effort、时间预算、工具调用、每次成功/失败与 token per completed task。

原始证据与数据

  • BenchLM 模型页明确写出:GLM-5.3 有 17 条来源可显示的 benchmark rows,但没有公开 overall score 或 rank;页面类别分数均为 pending。

  • BenchLM 方法论明确写出:公开表默认只展示 exact-source rows,生成的 benchmark values 不进入证据表;数据集刷新日期为 2026-08-17。

  • GLM-5.3 的逐项原始来源链接回指 Z.AI 发布文章 https://z.ai/blog/glm-5.3;因此本文将 BenchLM 作为可追溯目录,而不是第二个独立跑分方。

来源摘录或观察(仅做合规短引)

“GLM-5.3 is tracked, but not publicly ranked yet.”

“Public BenchLM benchmark tables default to exact-source rows only.”

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GLM-5.3

在 Tabbit 中使用并对比模型

GLM-5.3

相关测评

官方Z.ai 官方博客(智谱国际)2026-08-14

GLM-5.3 官方技术博客:前沿编程与涌现的网络安全能力(Z.ai)

媒体VentureBeat(美国科技媒体)2026-08-14

GLM-5.3 发布测评:先进网络安全能力与编程提升(VentureBeat)

媒体MindStudio(AI 开发平台官方博客)2026-08-14

GLM-5.3 独立基准测试:KingBench 3 得分 91.25%,登顶(MindStudio)

媒体EggStriker.AI Blog(中文 AI 资讯/测评站)2026-08-15

GLM-5.3 深度测评(2026年8月):最强的开源编程模型?(EggStriker.AI)

GLM-5.3

相关提示词

官方智谱AI开放文档(docs.bigmodel.cn,官方)

智谱官方 GLM-5.3 模型文档:核心参数与迁移说明(智谱AI开放文档)

官方智谱AI开放文档(docs.bigmodel.cn,官方)

智谱官方:提示词编写指南(GLM Coding 最佳实践)

社区AIHubMix Blog(AI 聚合 API 服务商教程)2026-08-14

GLM-5.3 上手指南:始终思考(Always-on Thinking)、三档推理与 API 支持矩阵(AIHubMix)

媒体Atoms.dev Blog(AI 模型聚合/指南站)2026-08-16

GLM-5.3 完整指南:基准、API、编码与开源权重(Atoms.dev)