GLM-5.3-Flash · 官方来源 · 厂商自报
Z.ai 对标准 GLM-5.3 的公开定位是:与 GLM-5.2 使用相同基座,能力提升来自扩展后训练,而不是更换预训练基座。重点方向包括长程软件工程、终端任务、工具调用和真实 Agent 工作单元。该基线可以解释为什么社区把一个 GLM-5.x 多模态变体称作“集成 GLM-5.2 级别智商”,但**不等于** Flash 已被官方命名或与标准 5.3 完全同构。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
Z.ai 对标准 GLM-5.3 的公开定位是:与 GLM-5.2 使用相同基座,能力提升来自扩展后训练,而不是更换预训练基座。重点方向包括长程软件工程、终端任务、工具调用和真实 Agent 工作单元。该基线可以解释为什么社区把一个 GLM-5.x 多模态变体称作“集成 GLM-5.2 级别智商”,但不等于 Flash 已被官方命名或与标准 5.3 完全同构。
Z.ai 技术资料给出的代表性厂商自报数据包括:Terminal-Bench 3.0 28.3(GLM-5.2 为 4.6)、DeepSWE v1.1 66.9(5.2 为 46.2)、CyberGym 84.5(5.2 为 77.2)、AutomationBench 48.2(5.2 为 26.2)。这些数字是标准 GLM-5.3 的公开基线,不能移植为 GLM-5.3 Flash/Ox Alpha 的成绩。
可说“Flash 延续 GLM-5.3/5.2 一脉的推理与 Agent 方向”,不可说“Flash 已复现上述全部分数”。任何 Flash 专属 benchmark 都需要独立、可复现的模型 ID 与测试条件。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
Z.ai 官方技术博客 · Z.ai · 原文发布日期 2026-08-14 · 本站编辑日期 2026-09-20
打开原始来源GLM-5.3-Flash
下载 Tabbit 客户端后检查模型可用性