Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GLM-5.3 · 社区来源 · 编辑分析

Reddit AIToolsPerformance:GLM-5.3 发布表拆解与本地自测清单

社区作者把厂商表拆成优势、短板和复测项目,适合规划验证而非直接下结论。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

社区来源编辑分析编辑日期 2026-09-20

测试条件速查

测试与来源边界
发布日社区分析未运行模型;数字来自 Z.ai,复测建议尚无输出。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified

关键数据与适用场景

一句话结论

这篇社区分析把 GLM-5.3 的发布表拆成“编码/Agent 真实优势、闭源前沿仍领先、所有数字暂属厂商报告”三层,并给出可在权重或 API 开放后复现的自测项目。

适用场景

  • 适合的任务:判断“最强开源模型”与“最强模型”两种说法的差别;为真实仓库、长链工具调用和成本效率设计 A/B 测试。

  • 不适合的任务:把作者的发布日分析当成独立跑分,或把 Z.ai 私有 Code Bench 的 50% 提升当作可外部审计事实。

  • 适用的模型版本:GLM-5.3 与发布表中的 GLM-5.2、Kimi K3、Fable 5、GPT-5.6 Sol 对照。

  • 适用的客户端、Agent 或 API:作者建议使用 Coding Plan/ZCode 做现阶段体验;独立 API 当时仍标注 coming soon。

  • 推荐的推理档位和参数:原文只确认 low/high/max 对外暴露,未提供可复现实验参数;不要从本文推断最优档位。

测试环境

  • 资料范围:Z.ai 发布文章、模型文档、发布日媒体报道与社区可见讨论。

  • 模型状态:2026-08-15 权重尚未开放,约两周安全审查后发布;因此作者没有自己的本地推理或 API 运行结果。

  • 数据性质:文中逐项表格均注明为 Z.ai 自报;社区帖用于解释差距与设计后续复测,而非替代原始 benchmark。

输入/配置

作者建议用户在可运行版本开放后固定以下任务集合:

  1. 仓库级任务:跨多个文件导航、修改和验证一个真实 bug。

  2. 长链工具任务:记录至少 20 次以上工具调用的正确率、失败恢复和最终交付,而不是只看首轮回答。

  3. 结构化输出:要求严格 JSON schema,并记录校验失败率与人工修正量。

  4. 真实交付指标:记录每个完成任务的 token 消耗,而不是单条响应的 token;同时记录人类在交付前需要改动的次数。

结果数据

基准GLM-5.2GLM-5.3对照/边界
Terminal-Bench 3.04.628.3Fable 5 33.7;GPT-5.6 Sol 34.6
DeepSWE v1.146.266.9Kimi K3 67.5;Fable 5 69.7
FrontierSWE67.578.1Fable 5 88.2
SWE-Marathon v1.119.442.5原文未列闭源对照
AutomationBench26.248.2原文未列完整对照
Agents’ Last Exam23.828.5GPT-5.6 Sol 28.6
HLE(with tools)54.762.5Fable 5 63.9;GPT-5.6 Sol 64.5
CyberGym77.284.5Fable/Mythos 5 83.8;GPT-5.6 Sol 83.6
ExploitBench24.454.4Fable/Mythos 5 78.0;GPT-5.6 Sol 76.5
ExploitGym(2h/6h)29/39105/130GPT-5.6 Sol 216/293
GDPval-AA v2未列1769Fable 5 1743;GPT-5.6 Sol 1730

结论

  • 能支持的选择判断:GLM-5.3 的发布数据最强地支持终端编码、长程 Agent、自动化和白盒漏洞发现等方向;在 DeepSWE、Terminal-Bench、ExploitBench 等项目上,闭源前沿仍有明确优势。

  • “最强开源”不等于“最强模型”:文章按 Z.ai 自报表重算后认为,GLM-5.3 在 GDPval-AA v2 与 CyberGym 是表内真实领先点,但不应据此宣布全面超过 Fable 5/GPT-5.6 Sol。

  • 最值得验证的数字是 token efficiency:Z.ai 说 GLM-5.3 在私有 Code Bench 上用更少输出 token 获得更高完成率;社区指出该数据尚无外部账单或公开任务可审计。

  • 安全能力需分层理解:CyberGym 的白盒发现/验证成绩很强,但 ExploitBench 与 ExploitGym 仍明显落后;发现漏洞、构造可靠 exploit、证明生产可达性与安全修复不是同一能力。

局限

  • 作者没有公开运行 GLM-5.3 的输入、seed、工具 harness、硬件、时间预算或逐次结果。

  • 所有表格数字来自 Z.ai 发布材料,属于厂商自报;社区作者明确写明尚无独立复现。

  • “约 744B MoE / 40B active”“1M context”“128K output”等规格也应以官方模型文档为准,不能由社区帖单独确认。

  • 帖中把 ExploitGym 的 2 小时/6 小时任务数用于横向说明,但不同模型吞吐归一化和时间预算细节可能影响比较。

  • 该帖的评论和价格信息会变化,本文只保留 2026-08-18 可见页面内容。

复现步骤

  1. 固定一个真实仓库,记录 commit、依赖、工具列表、上下文上限、effort 档位和时间预算。

  2. 先运行一个跨文件 bug 修复任务,要求模型先列计划,再修改、测试并给出 diff;保存所有工具调用与中间失败。

  3. 以同一提示和同一 harness 运行 GLM-5.3、GLM-5.2 与至少一个对照模型;不要只比较最终文本。

  4. 对每个模型重复多次,统计任务成功率、工具调用正确率、人工修正率、总延迟和“每个完成任务”的输入/输出/思考 token。

  5. 单独运行 JSON schema 校验、长链工具调用和安全代码审查三组任务;把发现漏洞、验证 exploit 与修复回归分别计分。

  6. 对照 Z.ai 发布表时标记哪些数字是 provider-reported,避免把复测结果和厂商表混在一起。

原始证据与数据

  • 原帖正文提供 GLM-5.2→5.3 的 11 项对照数字,并写明“Every benchmark number above is vendor-reported”。

  • 原帖列出 GLM-5.3 在 Terminal-Bench 3.0、DeepSWE、CyberGym、GDPval 等项目的对照分,并明确 ExploitBench/ExploitGym 仍落后闭源前沿。

  • 原帖的复测建议包含仓库级任务、长链工具调用、严格 JSON schema、交付前人工修正率和 token per completed task 五类指标。

  • 原帖引用的 Z.ai 原始资料:https://z.ai/blog/glm-5.3;本文以 Reddit 帖子作为分析来源,以 Z.ai 文章作为数据原始出处。

来源摘录或观察(仅做合规短引)

“Best open-weights model” and “best model” are two different claims, and only the first one holds up.

“Every benchmark number above is vendor-reported. Treat accordingly until third parties reproduce them.”

能支持的判断

  • 社区作者把厂商表拆成优势、短板和复测项目,适合规划验证而非直接下结论。(仅支持上述条件下的来源观察)。

不能支持的判断

  • 不支持把尚未运行的复测建议写成 GLM-5.3 实测结果。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Reddit r/AIToolsPerformance · IulianHI · 原文发布日期 2026-08-15 · 本站编辑日期 2026-09-20

打开原始来源

GLM-5.3

在 Tabbit 中比较 GLM-5.3

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

GLM-5.3 详解:相比 GLM-5.2 改变了什么

GLM-5.3 延续 GLM-5.2 基座,通过 post-training 强化长流程编程与智能体任务。本文比较变化、获取方式、成本和未知风险。

相关评测

GLM-5.3:BenchLM 源可核验基准账本与“不排名”结论exact-source 行适合追溯厂商数字;没有独立复测就不应形成总排名。GLM-5.3 没换基座,编程增益从哪来?后训练深度分析(The New Stack)媒体分析解释后训练、环境和验证器叙事,但不构成第三方性能复核。GLM-5.3 官方技术博客:前沿编程与涌现的网络安全能力(Z.ai)官方资料能支持发布口径与条件化基准记录,不支持扩展成全面第一。GLM-5.3 发布测评:先进网络安全能力与编程提升(VentureBeat)把发布日媒体报道中的网络安全、编码与迁移信息分开阅读,厂商跑分不等于独立复测。在 ZCode 里先计划再编辑在 ZCode 中先检查项目、批准计划,再以小任务验证 GLM-5.3 的编辑与测试流程。用分阶段上下文完成编码任务把项目上下文、目标、约束和验收标准写成可分阶段执行的编码任务。用 ZCode 观察缓存与上下文消耗用 ZCode 的缓存命中率和上下文拆分观察配额消耗,再决定是否继续长程编码任务。核对 Arena 的动态免费入口把 Arena 免费体验路径视为动态入口检查清单;正文不完整时不要补写步骤。