Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
社区GLM-5.3

Reddit AIToolsPerformance:GLM-5.3 发布表拆解与本地自测清单

原始来源

Reddit r/AIToolsPerformance

作者IulianHI

原文日期2026-08-15

Tabbit 整理2026-08-19

查看原文

一句话结论

这篇社区分析把 GLM-5.3 的发布表拆成“编码/Agent 真实优势、闭源前沿仍领先、所有数字暂属厂商报告”三层,并给出可在权重或 API 开放后复现的自测项目。

适用场景

  • 适合的任务:判断“最强开源模型”与“最强模型”两种说法的差别;为真实仓库、长链工具调用和成本效率设计 A/B 测试。

  • 不适合的任务:把作者的发布日分析当成独立跑分,或把 Z.ai 私有 Code Bench 的 50% 提升当作可外部审计事实。

  • 适用的模型版本:GLM-5.3 与发布表中的 GLM-5.2、Kimi K3、Fable 5、GPT-5.6 Sol 对照。

  • 适用的客户端、Agent 或 API:作者建议使用 Coding Plan/ZCode 做现阶段体验;独立 API 当时仍标注 coming soon。

  • 推荐的推理档位和参数:原文只确认 low/high/max 对外暴露,未提供可复现实验参数;不要从本文推断最优档位。

测试环境

  • 资料范围:Z.ai 发布文章、模型文档、发布日媒体报道与社区可见讨论。

  • 模型状态:2026-08-15 权重尚未开放,约两周安全审查后发布;因此作者没有自己的本地推理或 API 运行结果。

  • 数据性质:文中逐项表格均注明为 Z.ai 自报;社区帖用于解释差距与设计后续复测,而非替代原始 benchmark。

输入/配置

作者建议用户在可运行版本开放后固定以下任务集合:

  1. 仓库级任务:跨多个文件导航、修改和验证一个真实 bug。

  2. 长链工具任务:记录至少 20 次以上工具调用的正确率、失败恢复和最终交付,而不是只看首轮回答。

  3. 结构化输出:要求严格 JSON schema,并记录校验失败率与人工修正量。

  4. 真实交付指标:记录每个完成任务的 token 消耗,而不是单条响应的 token;同时记录人类在交付前需要改动的次数。

结果数据

基准GLM-5.2GLM-5.3对照/边界
Terminal-Bench 3.04.628.3Fable 5 33.7;GPT-5.6 Sol 34.6
DeepSWE v1.146.266.9Kimi K3 67.5;Fable 5 69.7
FrontierSWE67.578.1Fable 5 88.2
SWE-Marathon v1.119.442.5原文未列闭源对照
AutomationBench26.248.2原文未列完整对照
Agents’ Last Exam23.828.5GPT-5.6 Sol 28.6
HLE(with tools)54.762.5Fable 5 63.9;GPT-5.6 Sol 64.5
CyberGym77.284.5Fable/Mythos 5 83.8;GPT-5.6 Sol 83.6
ExploitBench24.454.4Fable/Mythos 5 78.0;GPT-5.6 Sol 76.5
ExploitGym(2h/6h)29/39105/130GPT-5.6 Sol 216/293
GDPval-AA v2未列1769Fable 5 1743;GPT-5.6 Sol 1730

结论

  • 能支持的选择判断:GLM-5.3 的发布数据最强地支持终端编码、长程 Agent、自动化和白盒漏洞发现等方向;在 DeepSWE、Terminal-Bench、ExploitBench 等项目上,闭源前沿仍有明确优势。

  • “最强开源”不等于“最强模型”:文章按 Z.ai 自报表重算后认为,GLM-5.3 在 GDPval-AA v2 与 CyberGym 是表内真实领先点,但不应据此宣布全面超过 Fable 5/GPT-5.6 Sol。

  • 最值得验证的数字是 token efficiency:Z.ai 说 GLM-5.3 在私有 Code Bench 上用更少输出 token 获得更高完成率;社区指出该数据尚无外部账单或公开任务可审计。

  • 安全能力需分层理解:CyberGym 的白盒发现/验证成绩很强,但 ExploitBench 与 ExploitGym 仍明显落后;发现漏洞、构造可靠 exploit、证明生产可达性与安全修复不是同一能力。

局限

  • 作者没有公开运行 GLM-5.3 的输入、seed、工具 harness、硬件、时间预算或逐次结果。

  • 所有表格数字来自 Z.ai 发布材料,属于厂商自报;社区作者明确写明尚无独立复现。

  • “约 744B MoE / 40B active”“1M context”“128K output”等规格也应以官方模型文档为准,不能由社区帖单独确认。

  • 帖中把 ExploitGym 的 2 小时/6 小时任务数用于横向说明,但不同模型吞吐归一化和时间预算细节可能影响比较。

  • 该帖的评论和价格信息会变化,本文只保留 2026-08-18 可见页面内容。

复现步骤

  1. 固定一个真实仓库,记录 commit、依赖、工具列表、上下文上限、effort 档位和时间预算。

  2. 先运行一个跨文件 bug 修复任务,要求模型先列计划,再修改、测试并给出 diff;保存所有工具调用与中间失败。

  3. 以同一提示和同一 harness 运行 GLM-5.3、GLM-5.2 与至少一个对照模型;不要只比较最终文本。

  4. 对每个模型重复多次,统计任务成功率、工具调用正确率、人工修正率、总延迟和“每个完成任务”的输入/输出/思考 token。

  5. 单独运行 JSON schema 校验、长链工具调用和安全代码审查三组任务;把发现漏洞、验证 exploit 与修复回归分别计分。

  6. 对照 Z.ai 发布表时标记哪些数字是 provider-reported,避免把复测结果和厂商表混在一起。

原始证据与数据

  • 原帖正文提供 GLM-5.2→5.3 的 11 项对照数字,并写明“Every benchmark number above is vendor-reported”。

  • 原帖列出 GLM-5.3 在 Terminal-Bench 3.0、DeepSWE、CyberGym、GDPval 等项目的对照分,并明确 ExploitBench/ExploitGym 仍落后闭源前沿。

  • 原帖的复测建议包含仓库级任务、长链工具调用、严格 JSON schema、交付前人工修正率和 token per completed task 五类指标。

  • 原帖引用的 Z.ai 原始资料:https://z.ai/blog/glm-5.3;本文以 Reddit 帖子作为分析来源,以 Z.ai 文章作为数据原始出处。

来源摘录或观察(仅做合规短引)

“Best open-weights model” and “best model” are two different claims, and only the first one holds up.

“Every benchmark number above is vendor-reported. Treat accordingly until third parties reproduce them.”

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GLM-5.3

在 Tabbit 中使用并对比模型

GLM-5.3

相关测评

官方Z.ai 官方博客(智谱国际)2026-08-14

GLM-5.3 官方技术博客:前沿编程与涌现的网络安全能力(Z.ai)

媒体VentureBeat(美国科技媒体)2026-08-14

GLM-5.3 发布测评:先进网络安全能力与编程提升(VentureBeat)

媒体MindStudio(AI 开发平台官方博客)2026-08-14

GLM-5.3 独立基准测试:KingBench 3 得分 91.25%,登顶(MindStudio)

媒体EggStriker.AI Blog(中文 AI 资讯/测评站)2026-08-15

GLM-5.3 深度测评(2026年8月):最强的开源编程模型?(EggStriker.AI)

GLM-5.3

相关提示词

官方智谱AI开放文档(docs.bigmodel.cn,官方)

智谱官方 GLM-5.3 模型文档:核心参数与迁移说明(智谱AI开放文档)

官方智谱AI开放文档(docs.bigmodel.cn,官方)

智谱官方:提示词编写指南(GLM Coding 最佳实践)

社区AIHubMix Blog(AI 聚合 API 服务商教程)2026-08-14

GLM-5.3 上手指南:始终思考(Always-on Thinking)、三档推理与 API 支持矩阵(AIHubMix)

媒体Atoms.dev Blog(AI 模型聚合/指南站)2026-08-16

GLM-5.3 完整指南:基准、API、编码与开源权重(Atoms.dev)