Tabbit博客

GLM-5.3 详解:相比 GLM-5.2 改变了什么

GLM-5.3 延续 GLM-5.2 基座,通过 post-training 强化长流程编程与智能体任务。本文比较变化、获取方式、成本和未知风险。

本文目录
  1. 先看结论
  2. GLM-5.3 规格与可用性
  3. 相比 GLM-5.2 改变了什么
  4. 现在怎么获取
  5. API
  6. Coding Plan 与 ZCode
  7. 本地权重
  8. Tabbit
  9. 仍然未知的风险
  10. 社区信号:与官方声明分开
  11. 选择前自检
  12. 来源
  13. 下一步

GLM-5.3 是一个以 GLM-5.2 为基座、面向长流程编程和智能体循环强化过的文本推理模型。如果你的任务包含代码仓库、工具调用或安全分析,它值得测试;但它不是每个 5.2 工作流的无条件替代品。GLM-5.3 模型页负责资源入口,本文只解释发布变化、获取边界和风险。

最影响决策的数字是官方同表中的 Terminal-Bench 3.0:GLM-5.3 为 28.3,GLM-5.2 为 4.6。这是基准的大幅变化,但不是个人成功率;测试工具、提示词、测试集和输出预算都会影响结果。把它当作值得做任务试点的理由,不要当作所有仓库都会提升的证明。

先看结论

  • 需要长流程编程、工具使用或可调推理力度的 API 模型时,优先把 GLM-5.3 放入试点。

  • 如果客户端依赖关闭思考、稳定预算或已知许可证,保留 GLM-5.2 作为对照。

  • API、Coding Plan、本地权重和 Tabbit 是四个不同的获取问题,不能混写。

  • 当前最强证据是 Z.ai 自己的基准;独立复现和你的 Tabbit 账号可用性仍最不确定。

GLM-5.3 规格与可用性

问题2026-09-20 核验结果边界
模型形态文本输入/输出;1M 上下文;最多 128K 输出服务商或客户端可能额外限制
推理始终开启;lowhighmax;文档默认 max旧的关闭思考请求不能直接假定有效
API 价格输入 $1.40/M、缓存输入 $0.26/M、输出 $4.40/M美元快照,价格会变化
Coding Plan当前套餐均列出 GLM-5.3;按 credits 和非高峰规则计量配额、旧套餐和并发取决于账号
本地选项Hugging Face 公开 zai-org/GLM-5.3 和部署说明当前标注 glm-5.3 许可证,需读完整条款
Tabbit国际版公共页面列出 GLM 5.3本次没有验证登录选择器或版本发布

官方依据包括 GLM-5.3 文档当前定价DevPack 计划说明Hugging Face 模型卡片。规格不等于权益;模型提示词评测评论分别回答使用和证据问题。

相比 GLM-5.2 改变了什么

Z.ai 说 GLM-5.3 使用同一个 GLM-5.2 基座,主要增益来自更强的 post-training。发布重点是复杂编程、长流程执行、终端环境和网络安全推理,不是已文档化的新架构。

维度GLM-5.2GLM-5.3实际影响
训练路线GLM-5.2 基座同一基座加 post-training先预期行为变化,不要假定 API 完全兼容
Terminal-Bench 3.04.628.3分别测试长循环、工具恢复和仓库状态
DeepSWE v1.146.266.9值得试点智能体编程,不保证你的技术栈同幅度提升
CyberGym77.284.5安全能力增强,也提高双用途风险
思考控制5.2 文档支持多模式强制开启;low/high/max,默认 max重新预算延迟和 token,复查关闭思考调用
迁移旧模型 ID 和参数新模型 ID,加 reasoning_effort 和工具流变化切生产前做回归测试

官方迁移指南建议检查延迟、随机性、参数完整性、流式输出和工具调用。post-training 可能改善智能体循环,这是从官方描述到机制影响的推断,不等于私有代码库也会同幅度提升。关于大上下文的成本取舍,可参考 GPT-5.6 Sol 的 1M 上下文说明

版本变化的实际含义是:5.3 更值得放进“需要持续读状态、调用工具、处理失败并继续”的任务,而不是只看一次问答的漂亮答案。始终开启思考会让请求结构、等待时间和输出预算发生变化;同一个提示在不同客户端中可能有不同的截断、缓存或工具流行为。迁移时应固定提示词、工具 schema、温度和停止条件,先比较十个代表任务,再决定是否扩大流量。

安全基准也要单独解释。更高的 CyberGym、ExploitBench 或 ExploitGym 数字说明模型能完成更多安全推理,但不代表输出已经经过生产安全审查,更不代表用户可以对第三方目标进行测试。对于防御性代码审查,可以把模型限制在脱敏仓库、只读工具和人工批准的补丁;对于真实漏洞验证,先确认授权和回滚路径。

现在怎么获取

API

Z.ai 当前文档列出 OpenAI Chat Completions、Responses 和 Anthropic 兼容端点。模型名设为 glm-5.3,保持思考开启,并明确选择 reasoning_effort。价格快照是输入 $1.40/M、缓存输入 $0.26/M、输出 $4.40/M;迁移前确认 endpoint、账单、地区和速率限制。把 API 迁移放在隔离环境,记录缓存命中、输出长度和工具重试,避免用一次短请求估算生产成本。

Coding Plan 与 ZCode

DevPack 页面把 GLM-5.3 列在 Lite、Pro、Max 套餐中,按 credits 而不是简单请求数计量,并记录非高峰折扣。ZCode 的当前文档说明 GLM-5.3 可用于代理开发环境和工作流。这是 Z.ai 的产品权益,不证明第三方客户端拥有相同配额。旧套餐、峰值时段和并发数可能不同,购买前应在自己的账户页重新核对。

API 价格和 Coding Plan 额度不能直接互换。API 适合把输入、缓存、输出和工具调用写进自己的账单;计划适合在 Z.ai 产品内使用,但 credits、峰值窗口和客户端工作流都会影响实际消耗。若任务必须在预算内完成,先用短任务测量,再选择更高推理力度,而不是默认使用 max

本地权重

Hugging Face 模型卡片公开 zai-org/GLM-5.3,给出 vLLM、SGLang、Transformers 和 Docker 路径。5.3 当前标注 glm-5.3,而 5.2 卡片显示 MIT;“能看到权重”和“允许你的部署方式”是两项检查。把硬件占用、量化方式、商业再分发和安全更新分开评估,不能只凭仓库公开就上线。

Tabbit

Tabbit 国际版公共页面列出 GLM 5.3,但本次没有登录账号或打开模型选择器,地区、版本、套餐和 rollout 都未知。可从 Tabbit 模型页开始,把AI 浏览器总览作为浏览器工作流背景,不把它们当作实时权益证明。若你看不到模型,应先确认账号和版本,再向产品支持核对,而不是把仓库或公开页面当作可用性证明。

Tabbit Browser

仍然未知的风险

独立性能。 Z.ai 的表适合判断方向和选择任务,但测试框架、私有基准和工具链由厂商控制。MindStudio 的 73/80 KingBench 是独立数据点,不是通用成功率。本文没有运行本地测试,也没有把社区结果当作复现。

额度与计量。 社区对 Coding Plan 的额度消耗、缓存计量、并发和重置时间反馈不一。把输入、缓存输入、输出、重试和峰值时段记录在同一账本中;没有账单原始数据,就只能把报告当作排查线索。

安全与权限。 CyberGym 分数表示能力,不表示授权。不要对没有权限的系统使用生成的 exploit chain;把密钥、生产凭证和不可逆操作排除在不受信任的循环之外。

许可证与 Tabbit 可用性。 5.3 当前模型卡片的 glm-5.3 标签不能自动继承 5.2 的 MIT 经验;公共 Tabbit 页面也不等于登录后的模型选择器。商业部署或切换前必须分别核对完整许可证、账号、地区和版本。

社区信号:与官方声明分开

独立反馈混合且高度依赖客户端。dptgreg 在 2026-08-14 的 SillyTavern 对比帖写道:“Better than 5.0 and 5.2. Better than 5.1? Unsure.” Vaxyu 则描述自己 preset 中的过度思考和自我审查。上下文、采样和角色卡都没有控制。

Comprehensive-Bet-83 在这篇 ZaiGLM 讨论中,将 GLM-5.3 作为关键认证、安全和 kernel C++ 工作的第二助手,称其“not bad at all”,但评论仍认为速度、价格和质量会波动。我们还找到 Fahd Mirza 于 2026-08-19 发布、讨论编程/安全/创意编程的第三方 GLM-5.3 YouTube review,原始页面只返回标题和元数据,未用来证明性能。

这篇 ZCode Workflows 讨论中,jfricker 于 2026-09-20 描述了 ZCode 3.14.0 的分阶段工作流,并说明自己用它审查大型代码库。这是 ZCode 客户端的工作流经验,不是 GLM-5.3 基准,也不证明 Tabbit 有相同入口。

选择前自检

  1. 任务: 是长流程编程/工具循环,还是普通文本?普通文本未必值得额外推理成本。

  2. 运行时: 需要 API、Coding Plan、本地权重还是 Tabbit?只选一条路径,并核对它自己的条款。

  3. 控制: 客户端能接受强制思考和 low/high/max 吗?不能就保留 5.2 或另一条基线。

  4. 预算: 能记录输入、缓存输入、输出、延迟、重试和工具调用吗?不能就不要从单次会话推断成本。

  5. 风险: 模型会看到密钥、部署代码、付款或系统探测权限吗?增加人工审批和最小权限。

  6. 证据: 能用同一 harness 跑十个代表任务比较质量、时间和成本吗?不能就把结论标为临时。

来源

官方与厂商: Z.ai GLM-5.3 文档GLM-5.2 文档迁移指南定价DevPackZCode 文档当前 Hugging Face 模型卡片,均于 2026-09-20 重开。它们支持规格、厂商基准、价格/计划快照、端点建议和许可证标签,不支持个人成功率或 Tabbit 账号可用性结论。

独立与社区原始页: SillyTavern 对比(dptgreg/Vaxyu,2026-08-14,SillyTavern 角色扮演)、ZaiGLM 编程比较(Comprehensive-Bet-83,2026-09-20,认证/安全/kernel C++)、套餐消耗报告(soemre,2026-08-22,OpenCode)、ZCode Workflows(jfricker,2026-09-20,ZCode 3.14.0)和 Fahd Mirza 的 YouTube review(2026-08-19,仅元数据)。Reddit 是环境相关观察,视频没有可核验转录;X 已尝试但原始 status 页面不可读,正文不引用 X。

下一步

先打开 GLM-5.3 模型入口,再选择提示词包评测评论。如果要做浏览器研究,可继续看AI 深度研究场景Tabbit 最佳实践什么是智能体浏览器。保留 5.2 基线,先核验真实访问,再记录十个任务结果,然后决定是否切换生产流量。

常见问题

GLM-5.3 是什么?

GLM-5.3 是 Z.ai 的文本推理模型,沿用 GLM-5.2 基座,并通过 post-training 强化长流程编程和智能体任务。Z.ai 报告了更强的编程和安全基准结果,但这不是所有项目的通用成功率。

GLM-5.3 相比 GLM-5.2 改变了什么?

主要变化是 post-training、始终开启的 low/high/max 推理力度、更新后的工具流迁移和更高的官方智能体基准。当前文档仍列出 1M 上下文和 128K 最大输出。

如何获取 GLM-5.3?

可以使用 Z.ai API、当前 Coding Plan,或通过 Hugging Face 模型卡片本地部署。Tabbit 国际版公共页面列出 GLM-5.3,但本次研究没有验证登录后的模型选择器,因此账号和版本可用性仍未知。

GLM-5.3 开源且免费吗?

当前 Hugging Face 页面公开模型仓库,并标注 glm-5.3 许可证,不是 GLM-5.2 卡片上的 MIT 标签。API 和 Coding Plan 按价格或额度计量,本地部署仍需审查许可证和硬件。

谁现在不该选择 GLM-5.3?

如果你需要关闭思考、跨客户端稳定的 token 计量、已验证的 Tabbit 入口、明确宽松的许可证,或独立复现的基准,就不应无条件切换。先保留基线并做回归测试。

下一步

让 Tabbit 与你并肩工作。

跨标签页调研、自动化重复的浏览器工作,让每一处上下文都触手可及。