GLM-5.3-Flash 模型测评导航
汇总 GLM-5.3-Flash 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。
官方
3 条已核对来源的资料OpenRouter:Ox Alpha 的公开规格——神秘模型首次现身
OpenRouter 将 Ox Alpha 列为匿名 stealth model,明确说明它由选择保持匿名的第三方开发和运营,OpenRouter 只是路由方。页面把它定位为 reasoning model,适合编码、持续 Agent 工作和生产负载,并强调结合视觉上下文的工作流。
X @OpenRouter:Ox Alpha 首次公开——1M 上下文与多模态输入
OpenRouter 的官方账号将 Ox Alpha 称为“new stealth model”,定位为面向高效编码、持续 Agent 工作与现实生产使用的前沿模型。帖子给出两项关键规格:100 万 token 上下文窗口,以及文本、图像和视频输入,并引导用户到 Ox Alpha 页面试用和反馈。
Z.ai 官方 GLM-5.3:承袭 GLM-5.2 基座的后训练能力基线
Z.ai 对标准 GLM-5.3 的公开定位是:与 GLM-5.2 使用相同基座,能力提升来自扩展后训练,而不是更换预训练基座。重点方向包括长程软件工程、终端任务、工具调用和真实 Agent 工作单元。该基线可以解释为什么社区把一个 GLM-5.x 多模态变体称作“集成 GLM-5.2 级别智商”,但不等于 Flash 已被官方命名或与标准 5.3 完全同构。
社区
2 条已核对来源的资料X @di_zhang_fdu:Ox Alpha 被指认为 GLM-5.3 Flash,但仍未官宣
Di Zhang 在 X 上直接写道:“Source: OxAlpha is GLM-5.3-Flash from Zhipu”,并引用了 OpenCode 关于 Ox Alpha 的公开信息(1M 上下文、多模态、零数据保留)。这是一条明确的社区归因,但不是 Z.ai 或 OpenRouter 的官方确认。
X @winkey_h:Ox Alpha 的 DeepSWE 子集体测与社区反馈
Wenqi/Kevin 分享了自己的早期体感与一个 DeepSWE 子集结果:平均每个任务约 47K 输出 token 时,Ox Alpha 得到约 63%。作者认为它在开源模型中处于 Pareto 前沿,与闭源模型相比仅略逊于 Grok 4.6;这属于个人测试与主观判断,不是标准化排行榜。
GLM-5.3-Flash
在 Tabbit 中使用并对比模型
汇总 GLM-5.3-Flash 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。