Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GLM-5.3-Flash · 官方来源 · 厂商自报

Z.ai 官方 GLM-5.3:承袭 GLM-5.2 基座的后训练能力基线

Z.ai 对标准 GLM-5.3 的公开定位是:与 GLM-5.2 使用相同基座,能力提升来自扩展后训练,而不是更换预训练基座。重点方向包括长程软件工程、终端任务、工具调用和真实 Agent 工作单元。该基线可以解释为什么社区把一个 GLM-5.x 多模态变体称作“集成 GLM-5.2 级别智商”,但**不等于** Flash 已被官方命名或与标准 5.3 完全同构。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

官方来源厂商自报编辑日期 2026-09-20

测试条件速查

模型/版本
GLM-5.3 Flash
来源
https://z.ai/blog/glm-5.3
采集/复核
2026-09-20;动态来源未重新打开
方法与样本
Z.ai 对标准 GLM-5.3 的公开定位是:与 GLM-5.2 使用相同基座,能力提升来自扩展后训练,而不是更换预训练基座。重点方向包括长程软件工程、终端任务、工具调用和真实 Agent 工作单元。该基线可以解释为什么社区把一个 GLM-5.x 多模态变体称作“集成 GLM-5.2 级别智商”,但**不等于** Flash 已被官方命名或与标准 5.3 完全同构。

关键数据与适用场景

核心内容摘要

Z.ai 对标准 GLM-5.3 的公开定位是:与 GLM-5.2 使用相同基座,能力提升来自扩展后训练,而不是更换预训练基座。重点方向包括长程软件工程、终端任务、工具调用和真实 Agent 工作单元。该基线可以解释为什么社区把一个 GLM-5.x 多模态变体称作“集成 GLM-5.2 级别智商”,但不等于 Flash 已被官方命名或与标准 5.3 完全同构。

官方基准(标准 GLM-5.3,非 Flash 实测)

Z.ai 技术资料给出的代表性厂商自报数据包括:Terminal-Bench 3.0 28.3(GLM-5.2 为 4.6)、DeepSWE v1.1 66.9(5.2 为 46.2)、CyberGym 84.5(5.2 为 77.2)、AutomationBench 48.2(5.2 为 26.2)。这些数字是标准 GLM-5.3 的公开基线,不能移植为 GLM-5.3 Flash/Ox Alpha 的成绩。

编辑使用建议

可说“Flash 延续 GLM-5.3/5.2 一脉的推理与 Agent 方向”,不可说“Flash 已复现上述全部分数”。任何 Flash 专属 benchmark 都需要独立、可复现的模型 ID 与测试条件。

能支持的判断

  • Z.ai 对标准 GLM-5.3 的公开定位是:与 GLM-5.2 使用相同基座,能力提升来自扩展后训练,而不是更换预训练基座。重点方向包括长程软件工程、终端任务、工具调用和真实 Agent 工作单元。该基线可以解释为什么社区把一个 GLM-5.x 多模态变体称作“集成 GLM-5.2 级别智商”,但**不等于** Flash 已被官方命名或与标准 5.3 完全同构。

不能支持的判断

  • Z.ai 页面描述的是标准 GLM-5.3 的训练与能力方向,没有命名 GLM-5.3 Flash,也没有把它与 Ox Alpha 关联;该基线不能证明两者共享权重、模态、上下文或 serving 配置。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Z.ai 官方技术博客 · Z.ai · 原文发布日期 2026-08-14 · 本站编辑日期 2026-09-20

打开原始来源

GLM-5.3-Flash

在 Tabbit 中比较 GLM-5.3-Flash

下载 Tabbit 客户端后检查模型可用性

相关评测

OpenRouter:Ox Alpha 的公开规格——神秘模型首次现身OpenRouter 将 Ox Alpha 列为匿名 stealth model,明确说明它由选择保持匿名的第三方开发和运营,OpenRouter 只是路由方。页面把它定位为 reasoning model,适合编码、持续 Agent 工作和生产负载,并强调结合视觉上下文的工作流。X @di_zhang_fdu:Ox Alpha 被指认为 GLM-5.3 Flash,但仍未官宣Di Zhang 在 X 上直接写道:“Source: OxAlpha is GLM-5.3-Flash from Zhipu”,并引用了 OpenCode 关于 Ox Alpha 的公开信息(1M 上下文、多模态、零数据保留)。这是一条明确的社区归因,但不是 Z.ai 或 OpenRouter 的官方确认。X @OpenRouter:Ox Alpha 首次公开——1M 上下文与多模态输入OpenRouter 的官方账号将 Ox Alpha 称为“new stealth model”,定位为面向高效编码、持续 Agent 工作与现实生产使用的前沿模型。帖子给出两项关键规格:**100 万 token 上下文窗口**,以及**文本、图像和视频输入**,并引导用户到 Ox Alpha 页面试用和反馈。X @winkey_h:Ox Alpha 的 DeepSWE 子集体测与社区反馈Wenqi/Kevin 分享了自己的早期体感与一个 DeepSWE 子集结果:平均每个任务约 47K 输出 token 时,Ox Alpha 得到约 **63%**。作者认为它在开源模型中处于 Pareto 前沿,与闭源模型相比仅略逊于 Grok 4.6;这属于个人测试与主观判断,不是标准化排行榜。 该帖引用了 OpenCode 关于 Ox Alpha 的公开信息(1M 上下文、多模态、零数据保留),但没有给出完整 prompt 集、任务数量、运行配置或代码。它也没有证明 Ox Alpha 的 GLM-5.3 Flash 身份。