Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GLM-5.3 · 媒体来源 · 编辑分析

GLM-5.3 深度测评(2026年8月):最强的开源编程模型?(EggStriker.AI)

深度测评把后训练增益与延迟开放、敏感能力控制放在同一叙事中,需区分事实和评论。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源编辑分析编辑日期 2026-09-20

测试条件速查

测试与来源边界
发布周二次分析,混合官方数字、价格判断和媒体评论;没有统一独立样本。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified

关键数据与适用场景

核心内容摘要

2026 年 8 月 14 日智谱(Z.ai,港股 02513)发布 GLM-5.3。它没有换架构、没有堆参数(743B,与 GLM-5.2 同一基座),几乎全部能力提升来自后训练缩放——用更长程的任务环境、更丰富的环境类型、更长的强化学习时间来"榨"出上限。发布时点智谱 ARR 已达 10 亿美元(国内第一家迈过该里程碑的大模型厂商)。

Key Takeaways

  • 743B 参数,与 GLM-5.2 同一基座,架构未变,提升全部来自后训练。

  • DeepSWE v1.1 66.9(开源第一);Terminal-Bench 3.0 4.6→28.3、SWE-Marathon 19.4→42.5。

  • CyberGym 84.5%,所有已评测模型中的第一(超 Mythos 5 的 83.8% 与 GPT-5.6 Sol 的 83.6%)。

  • 网络安全能力太强反而"拖累"发布:权重与 API 因安全加固延后约两周,敏感能力分级为"trusted access"。

工程细节

  • 基于开源 Slime 框架训练,端到端 RL 吞吐较既有方案提升 2.3 倍,让"更长程、更大规模 RL 后训练"在成本上可行。

  • Effort Level 机制:四档推理深度(Non-Thinking 非思考 + Low/High/Max 三档思考)。注意:本文写作时(8/15)官方文档称 5.3 支持 Non-Thinking,但 API 强制开启思考,实际与后续官方口径(仅 low/high/max)存在出入——以官方最新文档为准。

  • 因基座未变,5.2 时代的部署工具链、量化方案与推理基础设施可平滑迁移。

官方跑分(GLM-5.2 → 5.3,厂商自报、待独立复测)

基准GLM-5.2GLM-5.3
Terminal-Bench 3.04.628.3
DeepSWE v1.146.266.9(开源第一)
Agents' Last Exam (CLI)23.828.5
SWE-Marathon19.442.5
FrontierSWE67.578.1
AutomationBench—48.2
GDPVal-AA v2 (Elo)—1769
Toolathlon Verified—73.0
HLE with Tools—62.5–68.7
Z.ai Code Bench(@ Max)23.4%34.5%

与闭源旗舰的真实差距(官方口径)

  • Terminal-Bench 3.0:28.3 vs Fable 5(33.7)/ GPT-5.6 Sol(34.6),落后约 5–6 个点。

  • DeepSWE v1.1:66.9 vs Fable 5(69.7),落后不到 3 个点——差距从"代差"缩到"个位数",一年前开源落后闭源往往 20 分以上。

  • token 效率:Z.ai Code Bench 约 5 万 token/任务拿 31.4%,超过 Opus 4.8 用约 12 万 token 拿到的 29.5%——花不到一半 token 做得更好;仍落后 Fable 5(@Max 39.5%)。

  • 价格定位:官方称 API 定价约为美国前沿模型每 token 单价的十分之一(5.2 口径约 $1.4/$4.4 每百万 token,相对 Fable 5 的 $10/$50 约 1/7~1/11)。

网络安全:最强,也最"麻烦"

  • CyberGym 84.5% 全场第一;ExploitBench 54.4%(5.2 仅 24.4%,翻倍);ExploitGym 2 小时 105 个任务。

  • 官方披露:识别 2,436 个开源项目漏洞(269 个项目),1,097 个高危/严重;最早漏洞可追溯到 1981 年,平均"发现滞后"26.6 年。

  • 代价:权重与 API 延后约两周(预计 8 月底);敏感网络安全能力分级"trusted access",仅对审批合格用户开放;普通 API 用户被强制开启思考,只能在 low/high/max 中选择。

使用建议(中转站视角)

  • 截至 8/15:API 与可下载权重均未上线;当前可用渠道只有 GLM Coding Plan 订阅、ZCode、AutoClaw(发布当日起全量开放)。

  • 接入逻辑与 GLM-5.2 及其他 OpenAI 兼容模型完全一样——把 base_url 指向中转站的 OpenAI 兼容端点即可。

  • 注意:安全分级意味着"能跑通 API"≠"拿到全部网络安全能力";强制思考意味着成本估算不能按非思考档的便宜价格算。

结论

  • 一句话评价:开源阵营第一,全体模型还不是第一;与闭源第一梯队差距从"代差"缩小到"几个点",但还没追平。

  • 定位清晰:不是来抢"最强",而是抢"最强开源 + 最强性价比"(开源第一 + 价格约闭源 1/10 + token 效率优势)。

能支持的判断

  • 深度测评把后训练增益与延迟开放、敏感能力控制放在同一叙事中,需区分事实和评论。(仅支持上述条件下的来源观察)。

不能支持的判断

  • 不支持把二次分析中的价格判断和评论当作独立测量。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

EggStriker.AI Blog(中文 AI 资讯/测评站) · EggStriker.AI Team · 原文发布日期 2026-08-15 · 本站编辑日期 2026-09-20

打开原始来源

GLM-5.3

在 Tabbit 中比较 GLM-5.3

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

GLM-5.3 详解:相比 GLM-5.2 改变了什么

GLM-5.3 延续 GLM-5.2 基座,通过 post-training 强化长流程编程与智能体任务。本文比较变化、获取方式、成本和未知风险。

相关评测

Reddit r/LocalLLaMA:GLM 5.3 发布帖社区反应发布帖评论展示早期期待与疑问,不能推导稳定偏好或能力排名。X(推特)@Sal7one:长时间 Agent 运行 + 让 GLM 5.3 每小时审查代码“每隔几小时审查”是可复用流程想法,个人长程体验不是受控稳定性测试。GLM-5.3 发布测评:先进网络安全能力与编程提升(VentureBeat)把发布日媒体报道中的网络安全、编码与迁移信息分开阅读,厂商跑分不等于独立复测。GLM-5.3:BenchLM 源可核验基准账本与“不排名”结论exact-source 行适合追溯厂商数字;没有独立复测就不应形成总排名。用分阶段上下文完成编码任务把项目上下文、目标、约束和验收标准写成可分阶段执行的编码任务。在 ZCode 里先计划再编辑在 ZCode 中先检查项目、批准计划,再以小任务验证 GLM-5.3 的编辑与测试流程。区分 API、基准与权重状态按发布日材料区分 API、Coding Plan、基准口径与权重状态,避免把开源承诺写成当日可下载。用 ZCode 观察缓存与上下文消耗用 ZCode 的缓存命中率和上下文拆分观察配额消耗,再决定是否继续长程编码任务。