Wenqi/Kevin 分享了自己的早期体感与一个 DeepSWE 子集结果:平均每个任务约 47K 输出 token 时,Ox Alpha 得到约 63%。作者认为它在开源模型中处于 Pareto 前沿,与闭源模型相比仅略逊于 Grok 4.6;这属于个人测试与主观判断,不是标准化排行榜。
该帖引用了 OpenCode 关于 Ox Alpha 的公开信息(1M 上下文、多模态、零数据保留),但没有给出完整 prompt 集、任务数量、运行配置或代码。它也没有证明 Ox Alpha 的 GLM-5.3 Flash 身份。
“早期社区测试显示 Ox Alpha 在长程编码任务上有竞争力;但 63% 来自一个 DeepSWE 子集,不能替代完整 benchmark,也不能单独证明模型身份。”
该结果的价值是提供可追溯的个人实测数字;局限是子集、单次测试条件不透明,不能与 Z.ai 官方 GLM-5.3 v1.1 分数直接比较。
GLM-5.3-Flash