Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体GLM-5.3

GLM-5.3 深度测评(2026年8月):最强的开源编程模型?(EggStriker.AI)

原始来源

EggStriker.AI Blog(中文 AI 资讯/测评站)

作者EggStriker.AI Team

原文日期2026-08-15

Tabbit 整理2026-08-19

查看原文

核心内容摘要

2026 年 8 月 14 日智谱(Z.ai,港股 02513)发布 GLM-5.3。它没有换架构、没有堆参数(743B,与 GLM-5.2 同一基座),几乎全部能力提升来自后训练缩放——用更长程的任务环境、更丰富的环境类型、更长的强化学习时间来"榨"出上限。发布时点智谱 ARR 已达 10 亿美元(国内第一家迈过该里程碑的大模型厂商)。

Key Takeaways

  • 743B 参数,与 GLM-5.2 同一基座,架构未变,提升全部来自后训练。

  • DeepSWE v1.1 66.9(开源第一);Terminal-Bench 3.0 4.6→28.3、SWE-Marathon 19.4→42.5。

  • CyberGym 84.5%,所有已评测模型中的第一(超 Mythos 5 的 83.8% 与 GPT-5.6 Sol 的 83.6%)。

  • 网络安全能力太强反而"拖累"发布:权重与 API 因安全加固延后约两周,敏感能力分级为"trusted access"。

工程细节

  • 基于开源 Slime 框架训练,端到端 RL 吞吐较既有方案提升 2.3 倍,让"更长程、更大规模 RL 后训练"在成本上可行。

  • Effort Level 机制:四档推理深度(Non-Thinking 非思考 + Low/High/Max 三档思考)。注意:本文写作时(8/15)官方文档称 5.3 支持 Non-Thinking,但 API 强制开启思考,实际与后续官方口径(仅 low/high/max)存在出入——以官方最新文档为准。

  • 因基座未变,5.2 时代的部署工具链、量化方案与推理基础设施可平滑迁移。

官方跑分(GLM-5.2 → 5.3,厂商自报、待独立复测)

基准GLM-5.2GLM-5.3
Terminal-Bench 3.04.628.3
DeepSWE v1.146.266.9(开源第一)
Agents' Last Exam (CLI)23.828.5
SWE-Marathon19.442.5
FrontierSWE67.578.1
AutomationBench—48.2
GDPVal-AA v2 (Elo)—1769
Toolathlon Verified—73.0
HLE with Tools—62.5–68.7
Z.ai Code Bench(@ Max)23.4%34.5%

与闭源旗舰的真实差距(官方口径)

  • Terminal-Bench 3.0:28.3 vs Fable 5(33.7)/ GPT-5.6 Sol(34.6),落后约 5–6 个点。

  • DeepSWE v1.1:66.9 vs Fable 5(69.7),落后不到 3 个点——差距从"代差"缩到"个位数",一年前开源落后闭源往往 20 分以上。

  • token 效率:Z.ai Code Bench 约 5 万 token/任务拿 31.4%,超过 Opus 4.8 用约 12 万 token 拿到的 29.5%——花不到一半 token 做得更好;仍落后 Fable 5(@Max 39.5%)。

  • 价格定位:官方称 API 定价约为美国前沿模型每 token 单价的十分之一(5.2 口径约 $1.4/$4.4 每百万 token,相对 Fable 5 的 $10/$50 约 1/7~1/11)。

网络安全:最强,也最"麻烦"

  • CyberGym 84.5% 全场第一;ExploitBench 54.4%(5.2 仅 24.4%,翻倍);ExploitGym 2 小时 105 个任务。

  • 官方披露:识别 2,436 个开源项目漏洞(269 个项目),1,097 个高危/严重;最早漏洞可追溯到 1981 年,平均"发现滞后"26.6 年。

  • 代价:权重与 API 延后约两周(预计 8 月底);敏感网络安全能力分级"trusted access",仅对审批合格用户开放;普通 API 用户被强制开启思考,只能在 low/high/max 中选择。

使用建议(中转站视角)

  • 截至 8/15:API 与可下载权重均未上线;当前可用渠道只有 GLM Coding Plan 订阅、ZCode、AutoClaw(发布当日起全量开放)。

  • 接入逻辑与 GLM-5.2 及其他 OpenAI 兼容模型完全一样——把 base_url 指向中转站的 OpenAI 兼容端点即可。

  • 注意:安全分级意味着"能跑通 API"≠"拿到全部网络安全能力";强制思考意味着成本估算不能按非思考档的便宜价格算。

结论

  • 一句话评价:开源阵营第一,全体模型还不是第一;与闭源第一梯队差距从"代差"缩小到"几个点",但还没追平。

  • 定位清晰:不是来抢"最强",而是抢"最强开源 + 最强性价比"(开源第一 + 价格约闭源 1/10 + token 效率优势)。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GLM-5.3

在 Tabbit 中使用并对比模型

GLM-5.3

相关测评

官方Z.ai 官方博客(智谱国际)2026-08-14

GLM-5.3 官方技术博客:前沿编程与涌现的网络安全能力(Z.ai)

媒体VentureBeat(美国科技媒体)2026-08-14

GLM-5.3 发布测评:先进网络安全能力与编程提升(VentureBeat)

媒体MindStudio(AI 开发平台官方博客)2026-08-14

GLM-5.3 独立基准测试:KingBench 3 得分 91.25%,登顶(MindStudio)

媒体腾讯新闻(转载自爱范儿官方账号)2026-08-14

实测 GLM-5.3:神仙打架的一周杀回国模顶流(爱范儿/腾讯新闻)

GLM-5.3

相关提示词

官方智谱AI开放文档(docs.bigmodel.cn,官方)

智谱官方 GLM-5.3 模型文档:核心参数与迁移说明(智谱AI开放文档)

官方智谱AI开放文档(docs.bigmodel.cn,官方)

智谱官方:提示词编写指南(GLM Coding 最佳实践)

社区AIHubMix Blog(AI 聚合 API 服务商教程)2026-08-14

GLM-5.3 上手指南:始终思考(Always-on Thinking)、三档推理与 API 支持矩阵(AIHubMix)

媒体Atoms.dev Blog(AI 模型聚合/指南站)2026-08-16

GLM-5.3 完整指南:基准、API、编码与开源权重(Atoms.dev)