Z.ai 对标准 GLM-5.3 的公开定位是:与 GLM-5.2 使用相同基座,能力提升来自扩展后训练,而不是更换预训练基座。重点方向包括长程软件工程、终端任务、工具调用和真实 Agent 工作单元。该基线可以解释为什么社区把一个 GLM-5.x 多模态变体称作“集成 GLM-5.2 级别智商”,但不等于 Flash 已被官方命名或与标准 5.3 完全同构。
Z.ai 技术资料给出的代表性厂商自报数据包括:Terminal-Bench 3.0 28.3(GLM-5.2 为 4.6)、DeepSWE v1.1 66.9(5.2 为 46.2)、CyberGym 84.5(5.2 为 77.2)、AutomationBench 48.2(5.2 为 26.2)。这些数字是标准 GLM-5.3 的公开基线,不能移植为 GLM-5.3 Flash/Ox Alpha 的成绩。
可说“Flash 延续 GLM-5.3/5.2 一脉的推理与 Agent 方向”,不可说“Flash 已复现上述全部分数”。任何 Flash 专属 benchmark 都需要独立、可复现的模型 ID 与测试条件。
GLM-5.3-Flash