Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GLM-5.3 · 媒体来源 · 平台遥测

GLM-5.3:BenchLM 源可核验基准账本与“不排名”结论

exact-source 行适合追溯厂商数字;没有独立复测就不应形成总排名。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源平台遥测编辑日期 2026-09-20

测试条件速查

测试与来源边界
2026-08-17 目录快照,17 条来源可见记录;原始行回指 Z.ai,未运行模型。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified

关键数据与适用场景

一句话结论

BenchLM 收录了 GLM-5.3 的 17 条“原始来源可显示”跑分,但因缺少独立复测而不给综合分或排名,当前更适合把它当作可追溯的厂商数据账本,而不是独立排行榜。

适用场景

  • 适合的任务:核对 GLM-5.3 已公开的编码、Agent 与安全基准;快速查看每个数字的来源状态;制定等待权重开放后的复测清单。

  • 不适合的任务:把页面分数当成独立测评、综合能力排名或真实项目成功率。

  • 适用的模型版本:GLM-5.3(页面标注 2026-08-14 发布)。

  • 适用的客户端、Agent 或 API:与客户端无关;数据来自 Z.AI 发布表,当前可通过 Coding Plan/ZCode 使用。

  • 推荐的推理档位和参数:BenchLM 未执行调用,未公开参数;不能据此推断 low/high/max 的实际差异。

测试环境

  • 数据源:BenchLM 模型页;其方法论页面说明公开表默认只展示“exact-source rows”,排除生成或推测的跑分。

  • 数据刷新时间:2026-08-17。

  • 记录状态:GLM-5.3 有 17 条可显示基准记录;Agentic 与 Coding 类别各收录 8 条,另有 1 条 External signals;Reasoning、Knowledge、Math、Multilingual、Multimodal、Instruction Following 均标记为未测量。

  • 独立性:页面明确将这些行标记为 Provider exact,原始链接均回指 Z.AI 发布文章;没有独立运行的输入、配置、seed 或逐次结果。

结果数据

Coding / Agentic

基准GLM-5.3页面记录的最佳已核验对照证据状态
Terminal-Bench 2.188.2%GLM-5.3 当前最佳已核验行Provider exact
Terminal-Bench 3.028.3%GLM-5.3 当前最佳已核验行Provider exact
DeepSWE v1.166.9%GPT-5.6 Sol 72.7%,落后 5.8 个百分点Provider exact
NL2Repo58.0%DeepSeek V4 Pro 0813 61.5%,落后 3.5 个百分点Provider exact
ProgramBench19.0%Claude Opus 5 93.0%,页面差距 74 个百分点Provider exact
FrontierSWE78.1%Kimi K3 81.2%,落后 3.1 个百分点Provider exact
SWE-Marathon v1.142.5%GLM-5.3 当前最佳已核验行Provider exact
PostTrainBench39.8%GLM-5.3 当前最佳已核验行Provider exact
CyberGym84.5%Fugu Cyber 86.9%,落后 2.4 个百分点Provider exact
ExploitGym页面归一化值 15.0%GPT-5.6 Sol 33.7%,落后 18.7 个百分点Provider exact
Toolathlon-Verified73.0%Claude Opus 5 80.6%,落后 7.6 个百分点Provider exact
AutomationBench48.2%GLM-5.3 当前最佳已核验行Provider exact
Agents' Last Exam28.5%Qwen3.8 Max 52.4%,落后 23.9 个百分点Provider exact
HLE with tools62.5%Claude Opus 5 64.7%,落后 2.2 个百分点Provider exact
ExploitBench54.0%Claude Mythos 5 78.0%,落后 23.6 个百分点Provider exact

BenchLM 页面还列出 GDPval-AA v2 1769,但将其作为厂商来源记录而非独立验证分数;页面据此仍保持“Score pending / Not ranked”。

结论

  1. 可确认的事实:GLM-5.3 的公开数字主要集中在终端编码、长程 Agent 和漏洞发现/利用相关测试;BenchLM 能把这些数字与 Z.AI 原文逐条关联。

  2. 不能确认的事实:这些分数能否在其他 harness、推理栈、预算、模型提供商或本地权重上复现;GLM-5.3 的综合能力排名;官方 token 效率声明是否转化为真实任务成本下降。

  3. 选型含义:GLM-5.3 在 BenchLM 的数据上更像“编码/Agent 证据充分、通用能力证据缺口明显”的模型。页面未测量多模态、数学、知识与指令遵循,因此不应把编码成绩外推为全能表现。

  4. 与厂商表的边界:BenchLM 的“best verified row”仅表示目录中目前可追溯的最高来源记录,不等于 BenchLM 重新跑出了该分数。

局限

  • 所有 GLM-5.3 行的证据状态均为 Provider exact,且原始链接指向 Z.AI;它不是独立受控测评。

  • 页面没有公开 GLM-5.3 的请求输入、工具 schema、时间预算、采样参数、rollout 数、硬件或逐次结果。

  • ExploitGym 在目录中被归一化为 15.0%,而 Z.AI 发布表同时以 2 小时/6 小时完成任务数(105/130)呈现;两种表示不可直接等同,需查看 BenchLM 的归一化定义后再比较。

  • 页面数据会随着模型目录更新而变化;本文只记录 2026-08-17 快照。

复现步骤

  1. 打开 https://benchlm.ai/models/glm-5-3,记录页面数据日期、17 条 source-displayable rows 与“Score pending / Not ranked”状态。

  2. 点击每条记录的 Z.AI 原始链接,核对 benchmark 名称、GLM-5.3 数字和对照表;不要把 Google 摘要或第三方转述当作结果。

  3. 打开 https://benchlm.ai/methodology,确认该目录只把 exact-source rows 纳入公开表,并检查数据刷新日期。

  4. 若要做真正独立复测,等待可下载权重或可计量 API 后,在固定仓库与工具 harness 下重复同一任务,记录输入、上下文、effort、时间预算、工具调用、每次成功/失败与 token per completed task。

原始证据与数据

  • BenchLM 模型页明确写出:GLM-5.3 有 17 条来源可显示的 benchmark rows,但没有公开 overall score 或 rank;页面类别分数均为 pending。

  • BenchLM 方法论明确写出:公开表默认只展示 exact-source rows,生成的 benchmark values 不进入证据表;数据集刷新日期为 2026-08-17。

  • GLM-5.3 的逐项原始来源链接回指 Z.AI 发布文章 https://z.ai/blog/glm-5.3;因此本文将 BenchLM 作为可追溯目录,而不是第二个独立跑分方。

来源摘录或观察(仅做合规短引)

“GLM-5.3 is tracked, but not publicly ranked yet.”

“Public BenchLM benchmark tables default to exact-source rows only.”

能支持的判断

  • exact-source 行适合追溯厂商数字;没有独立复测就不应形成总排名。(仅支持上述条件下的来源观察)。

不能支持的判断

  • 不支持把回指 Z.ai 的账本行当作 BenchLM 独立复测或当前排名。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

BenchLM(第三方模型基准目录) · BenchLM 编辑/数据团队(署名未公开) · 原文发布日期 2026-08-17 · 本站编辑日期 2026-09-20

打开原始来源

GLM-5.3

在 Tabbit 中比较 GLM-5.3

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

GLM-5.3 详解:相比 GLM-5.2 改变了什么

GLM-5.3 延续 GLM-5.2 基座,通过 post-training 强化长流程编程与智能体任务。本文比较变化、获取方式、成本和未知风险。

相关评测

GLM-5.3 没换基座,编程增益从哪来?后训练深度分析(The New Stack)媒体分析解释后训练、环境和验证器叙事,但不构成第三方性能复核。Reddit AIToolsPerformance:GLM-5.3 发布表拆解与本地自测清单社区作者把厂商表拆成优势、短板和复测项目,适合规划验证而非直接下结论。GLM-5.3 发布测评:先进网络安全能力与编程提升(VentureBeat)把发布日媒体报道中的网络安全、编码与迁移信息分开阅读,厂商跑分不等于独立复测。GLM-5.3 官方技术博客:前沿编程与涌现的网络安全能力(Z.ai)官方资料能支持发布口径与条件化基准记录,不支持扩展成全面第一。用分阶段上下文完成编码任务把项目上下文、目标、约束和验收标准写成可分阶段执行的编码任务。在 ZCode 里先计划再编辑在 ZCode 中先检查项目、批准计划,再以小任务验证 GLM-5.3 的编辑与测试流程。区分 API、基准与权重状态按发布日材料区分 API、Coding Plan、基准口径与权重状态,避免把开源承诺写成当日可下载。用 ZCode 观察缓存与上下文消耗用 ZCode 的缓存命中率和上下文拆分观察配额消耗,再决定是否继续长程编码任务。