Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GLM-5.3 · 媒体来源 · 编辑分析

GLM-5.3 发布测评:先进网络安全能力与编程提升(VentureBeat)

把发布日媒体报道中的网络安全、编码与迁移信息分开阅读,厂商跑分不等于独立复测。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源编辑分析编辑日期 2026-09-20

测试条件速查

测试与来源边界
媒体报道含厂商发布信息与对照跑分;未公开统一复测 harness。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified

关键数据与适用场景

核心内容摘要

中国 AI 初创公司 Z.ai(智谱国际名)于 2026 年 8 月 14 日发布 GLM-5.3,主打长程编程(long-horizon coding)能力大幅提升,以及更具争议性的网络安全能力跃升。据报道,GLM-5.3 的网络安全能力已经发现 Cursor(被 SpaceX 收购的 AI 编程公司)的一个"潜在严重漏洞"。

发布与获取方式

  • 初期仅通过 GLM Coding Plan 和 ZCode 编程环境提供;API 与开源权重"待安全评估与加固完成后"再开放,权重预计发布约两周后放出。

  • 对企业开发者而言,本次发布的核心不是又一轮跑分提升,而是同一基座、纯后训练的路线验证:Z.ai 称 GLM-5.3 使用与 GLM-5.2 相同的基座模型,全部提升来自扩展后训练(更多环境、更多样任务、更多强化学习算力)。"Scaling post-training is all we did for GLM-5.3."

关键跑分(厂商自报)

基准GLM-5.2GLM-5.3
Terminal-Bench 3.04.628.3
DeepSWE v1.146.266.9
AutomationBench26.248.2
Agents' Last Exam CLI23.828.5
  • 对照:Terminal-Bench 3.0 上 GPT-5.6 Sol 为 34.6、Claude Fable 5 为 33.7;DeepSWE v1.1 上 GPT-5.6 Sol 为 72.7、Fable 5 为 69.7——即未全面超越闭源旗舰。

  • 效率亮点(Z.ai 私有 Z.ai Code Bench):Max 档 34.5% @ 约 7.5 万输出 token/任务(5.2 为 23.4% @ 约 9.6 万);High 档 31.4% @ 约 5 万 token,超过 Claude Opus 4.8 的 29.5% @ 12 万 token。

网络安全能力(本次最大争议点)

  • Z.ai 原以为加入漏洞发现环境只会让模型更擅长"找漏洞",结果随着训练规模扩大,能力沿漏洞利用链(exploitation chain)快速延伸,"cyber capability developed faster than we expected"。

  • CyberGym(漏洞发现与验证):GLM-5.3 84.5% vs GLM-5.2 77.2%,略超 GPT-5.6 Sol(83.6%)与 Mythos 5(83.8%)。

  • ExploitBench(真实漏洞利用推理):54.4%,是 5.2(24.4%)的两倍多,但仍远低于 GPT-5.6 Sol(76.5%)与 Mythos 5(78%)。

  • ExploitGym:2 小时完成 105 个任务、6 小时 130 个(5.2 为 29/39);Fable 5 为 181/247,GPT-5.6 Sol 为 216/293。

  • 实战:与中国安全团队合作,经专家复核共发现 2,436 个漏洞(269 个项目),其中 1,097 个为严重或高危;53 个已公开披露,2,383 个仍处于保密(embargo)状态。

  • 路透社报道 Z.ai 正在为部分敏感能力引入"trusted access"(可信访问)控制。

对开发者的 API 破坏性变更

  • GLM-5.3 支持 low / high / max 三档 reasoning effort(默认 max,官方推荐 coding 用 max)。

  • 思考无法关闭:之前发送 thinking.type: "disabled" 的应用必须改为 enabled 并指定 effort,否则请求失败——这是一次真正的迁移,不是简单换模型名。

媒体评价要点

  • 定位:开源模型能否"不花一次昂贵预训练"把前沿规模基座推到极限的试金石。

  • 双刃剑:同样的长程 Agent 能力,既让模型更适合软件工程,也可能让它成为更强的攻击者。

原文关键引文

"Scaling post-training is all we did for GLM-5.3."

"As we scaled post-training, cyber capability developed faster than we expected."

"That makes GLM-5.3 an actual migration rather than simply a model-name substitution for some production applications."

能支持的判断

  • 把发布日媒体报道中的网络安全、编码与迁移信息分开阅读,厂商跑分不等于独立复测。(仅支持上述条件下的来源观察)。

不能支持的判断

  • 不支持把媒体转述的厂商分数当作独立复测,也不支持推导当前价格或可用性。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

VentureBeat(美国科技媒体) · Carl Franzen · 原文发布日期 2026-08-14 · 本站编辑日期 2026-09-20

打开原始来源

GLM-5.3

在 Tabbit 中比较 GLM-5.3

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

GLM-5.3 详解:相比 GLM-5.2 改变了什么

GLM-5.3 延续 GLM-5.2 基座,通过 post-training 强化长流程编程与智能体任务。本文比较变化、获取方式、成本和未知风险。

相关评测

GLM-5.3 官方技术博客:前沿编程与涌现的网络安全能力(Z.ai)官方资料能支持发布口径与条件化基准记录,不支持扩展成全面第一。GLM 5.3 硬刚 Kimi K3:不换基座的极限压榨(腾讯云开发者社区)同一文章的对比可定位任务差异,但不能把两套客户端条件合成总分。X(推特)@Ubendev:GLM 5.3 发现 Claude 所写后端代码的 10 个严重 bug“发现 10 个 bug”是单次工作流结果,支持交叉审查作为流程,不支持普遍发现率。GLM-5.3 独立基准测试:KingBench 3 得分 91.25%,登顶(MindStudio)固定提示词集提供有条件的外部参照,但不能替代多次复测。用分阶段上下文完成编码任务把项目上下文、目标、约束和验收标准写成可分阶段执行的编码任务。在 ZCode 里先计划再编辑在 ZCode 中先检查项目、批准计划,再以小任务验证 GLM-5.3 的编辑与测试流程。区分 API、基准与权重状态按发布日材料区分 API、Coding Plan、基准口径与权重状态,避免把开源承诺写成当日可下载。用 ZCode 观察缓存与上下文消耗用 ZCode 的缓存命中率和上下文拆分观察配额消耗,再决定是否继续长程编码任务。