Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体GLM-5.3

GLM-5.3 发布测评:先进网络安全能力与编程提升(VentureBeat)

原始来源

VentureBeat(美国科技媒体)

作者Carl Franzen

原文日期2026-08-14

Tabbit 整理2026-08-19

查看原文

核心内容摘要

中国 AI 初创公司 Z.ai(智谱国际名)于 2026 年 8 月 14 日发布 GLM-5.3,主打长程编程(long-horizon coding)能力大幅提升,以及更具争议性的网络安全能力跃升。据报道,GLM-5.3 的网络安全能力已经发现 Cursor(被 SpaceX 收购的 AI 编程公司)的一个"潜在严重漏洞"。

发布与获取方式

  • 初期仅通过 GLM Coding Plan 和 ZCode 编程环境提供;API 与开源权重"待安全评估与加固完成后"再开放,权重预计发布约两周后放出。

  • 对企业开发者而言,本次发布的核心不是又一轮跑分提升,而是同一基座、纯后训练的路线验证:Z.ai 称 GLM-5.3 使用与 GLM-5.2 相同的基座模型,全部提升来自扩展后训练(更多环境、更多样任务、更多强化学习算力)。"Scaling post-training is all we did for GLM-5.3."

关键跑分(厂商自报)

基准GLM-5.2GLM-5.3
Terminal-Bench 3.04.628.3
DeepSWE v1.146.266.9
AutomationBench26.248.2
Agents' Last Exam CLI23.828.5
  • 对照:Terminal-Bench 3.0 上 GPT-5.6 Sol 为 34.6、Claude Fable 5 为 33.7;DeepSWE v1.1 上 GPT-5.6 Sol 为 72.7、Fable 5 为 69.7——即未全面超越闭源旗舰。

  • 效率亮点(Z.ai 私有 Z.ai Code Bench):Max 档 34.5% @ 约 7.5 万输出 token/任务(5.2 为 23.4% @ 约 9.6 万);High 档 31.4% @ 约 5 万 token,超过 Claude Opus 4.8 的 29.5% @ 12 万 token。

网络安全能力(本次最大争议点)

  • Z.ai 原以为加入漏洞发现环境只会让模型更擅长"找漏洞",结果随着训练规模扩大,能力沿漏洞利用链(exploitation chain)快速延伸,"cyber capability developed faster than we expected"。

  • CyberGym(漏洞发现与验证):GLM-5.3 84.5% vs GLM-5.2 77.2%,略超 GPT-5.6 Sol(83.6%)与 Mythos 5(83.8%)。

  • ExploitBench(真实漏洞利用推理):54.4%,是 5.2(24.4%)的两倍多,但仍远低于 GPT-5.6 Sol(76.5%)与 Mythos 5(78%)。

  • ExploitGym:2 小时完成 105 个任务、6 小时 130 个(5.2 为 29/39);Fable 5 为 181/247,GPT-5.6 Sol 为 216/293。

  • 实战:与中国安全团队合作,经专家复核共发现 2,436 个漏洞(269 个项目),其中 1,097 个为严重或高危;53 个已公开披露,2,383 个仍处于保密(embargo)状态。

  • 路透社报道 Z.ai 正在为部分敏感能力引入"trusted access"(可信访问)控制。

对开发者的 API 破坏性变更

  • GLM-5.3 支持 low / high / max 三档 reasoning effort(默认 max,官方推荐 coding 用 max)。

  • 思考无法关闭:之前发送 thinking.type: "disabled" 的应用必须改为 enabled 并指定 effort,否则请求失败——这是一次真正的迁移,不是简单换模型名。

媒体评价要点

  • 定位:开源模型能否"不花一次昂贵预训练"把前沿规模基座推到极限的试金石。

  • 双刃剑:同样的长程 Agent 能力,既让模型更适合软件工程,也可能让它成为更强的攻击者。

原文关键引文

"Scaling post-training is all we did for GLM-5.3."

"As we scaled post-training, cyber capability developed faster than we expected."

"That makes GLM-5.3 an actual migration rather than simply a model-name substitution for some production applications."

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GLM-5.3

在 Tabbit 中使用并对比模型

GLM-5.3

相关测评

官方Z.ai 官方博客(智谱国际)2026-08-14

GLM-5.3 官方技术博客:前沿编程与涌现的网络安全能力(Z.ai)

媒体MindStudio(AI 开发平台官方博客)2026-08-14

GLM-5.3 独立基准测试:KingBench 3 得分 91.25%,登顶(MindStudio)

媒体EggStriker.AI Blog(中文 AI 资讯/测评站)2026-08-15

GLM-5.3 深度测评(2026年8月):最强的开源编程模型?(EggStriker.AI)

媒体腾讯新闻(转载自爱范儿官方账号)2026-08-14

实测 GLM-5.3:神仙打架的一周杀回国模顶流(爱范儿/腾讯新闻)

GLM-5.3

相关提示词

官方智谱AI开放文档(docs.bigmodel.cn,官方)

智谱官方 GLM-5.3 模型文档:核心参数与迁移说明(智谱AI开放文档)

官方智谱AI开放文档(docs.bigmodel.cn,官方)

智谱官方:提示词编写指南(GLM Coding 最佳实践)

社区AIHubMix Blog(AI 聚合 API 服务商教程)2026-08-14

GLM-5.3 上手指南:始终思考(Always-on Thinking)、三档推理与 API 支持矩阵(AIHubMix)

媒体Atoms.dev Blog(AI 模型聚合/指南站)2026-08-16

GLM-5.3 完整指南:基准、API、编码与开源权重(Atoms.dev)