Tabbit博客

Ox Alpha 到底是谁?为何大家猜它是 GLM-5.3 Flash

Ox Alpha 很像 GLM-5.x 的多模态分支,但 GLM-5.3 Flash 仍未获官方确认。本文按时间线拆解线索、实测与 Tabbit 使用入口。

本文目录
  1. 先说结论
  2. Ox Alpha 身份线索一览
  3. 这场身份猜测是怎么开始的
  4. 8 月 14 日:标准 GLM-5.3 先发布
  5. 8 月 21 日:Ox Alpha 匿名上线
  6. 8 月 23 日到 25 日:社区开始“验指纹”
  7. “GLM-5.2 的智慧加原生多模态”是什么意思
  8. 网友测出来的数据到底能说明什么
  9. 在 Tabbit 里把猜测变成自己的测试
  10. 现在应该相信到哪一步

Ox Alpha 很可能是运行在 Z.ai 服务栈上的 GLM-5.x 多模态模型。这是目前公开线索能支持的最稳结论。再往前一步,说它就是 GLM-5.3 Flash,证据还差一张官方模型卡。OpenRouter 和 Z.ai 都没确认。

偏偏这个匿名模型已经做出了一些让人很难不多看两眼的结果。Reddit 有人用一句话让它画“骑自行车的龙”,评论区注意到龙腿在车架后面、自行车在路上,还有链条。测试很小,却很具体。大家关心的不只是“谁做的”,也在看它到底会不会干活。

下面按时间把故事拼起来,再把标准 GLM-5.3 的官方数据和 Ox Alpha 的网友实测分开。如果不想继续猜代号,也可以直接打开 Tabbit 的 GLM-5.3 Flash 模型页,拿自己的文字、图片和 Agent 任务试一轮。

先说结论

  • OpenRouter 确认的是匿名第三方模型、1,048,576 token 上下文,以及文本、图像、视频输入。官方资料没有出现 Z.ai 或 GLM 名称。

  • Tokenizer、视频 token 预算和服务端报错共同指向 GLM-5.x 家族与 Z.ai 服务栈,但还不能锁定具体 checkpoint。

  • Z.ai 表示公开版 GLM-5.3 与 GLM-5.2 使用同一个 base model,提升来自后训练。如果 Flash 归因正确,“GLM-5.2 的智能底座加原生多模态”就说得通。

  • Ox Alpha 的好成绩大多来自个人测试、子集或单个任务。它们值得跟进,不能冒充完整 benchmark。

  • Tabbit 已按 GLM-5.3 Flash 提供使用入口。产品名称解决的是怎么用,不等于替官方完成身份确认。

Ox Alpha 身份线索一览

说法现有证据可信度还不能证明什么
Ox Alpha 是真实存在的匿名预览模型OpenRouter 模型记录已确认谁开发、谁运营底层 checkpoint
它有 1M 上下文并支持多模态OpenRouter 官方公告写明文本、图片、视频输入已确认视觉准确率、稳定的视频上限、长期可用性
它属于 GLM-5.x 家族技术社区长文汇总 tokenizer、视频 token 和报错指纹较强推论权重相同或公开 SKU 相同
它就是 GLM-5.3 FlashDi Zhang 的归因帖等社区说法未确认官方产品名、API ID、Z.ai 官宣
它继承了 GLM-5.2 的智能底座Z.ai 说明公开 GLM-5.3 与 GLM-5.2 同 base有条件成立Ox Alpha 一定使用相同 checkpoint 和全部训练流程

压成一句话:GLM 家族很像,Z.ai 托管也很像,具体叫不叫 GLM-5.3 Flash 还没实锤。

这场身份猜测是怎么开始的

8 月 14 日:标准 GLM-5.3 先发布

Z.ai 在 GLM-5.3 技术博客里写得很直白:GLM-5.3 和 GLM-5.2 使用同一个 base model,所有增益来自继续扩大后训练。新的训练覆盖更多环境、更复杂的长任务和更大的计算量。

这给后来的 Flash 猜测补上了一条技术路线。一个更快、支持视觉的分支,不必抛弃 GLM-5.2 的语言与推理底座。它可以保留这套能力,再换一套服务配置并接入视觉输入。已经用过 Tabbit 中的 GLM-5.2 的人,也正好有一个可以对照语气和指令遵循的基线。

边界也很清楚:Z.ai 这篇文章只讲公开版 GLM-5.3,没有出现 Ox Alpha 或 GLM-5.3 Flash。

8 月 21 日:Ox Alpha 匿名上线

OpenRouter 把 stealth/ox-alpha 作为免费预览模型上线。模型页给出的定位是编码、持续 Agent 工作和生产任务。上下文窗口为 1,048,576 token,最大输出 131,072 token。

真正让身份调查热起来的是另一项规格:OpenRouter 官方 X 账号写明它接受文本、图像和视频。公开版 GLM-5.3 有长上下文和编码能力,GLM-5V-Turbo 则是 GLM 家族里现成的视觉路线。Ox Alpha 看上去像两条线在一张尚未公开的模型卡上汇合了。

OpenRouter 同时说明,模型由匿名第三方开发和运营,它只负责路由。提供商会保留 prompt 和 completion,但不用于训练,其他用途受 Stealth Model Terms 约束。免费很好用,不等于没有隐私成本。

8 月 23 日到 25 日:社区开始“验指纹”

TechCrunch 的早期报道记录了第一轮混乱:有人猜 GLM,也有人猜微软 MAI,Reddit 上的判断更分散。当时根本谈不上共识。

随后出现的技术线索扎实得多。Jonathan Turner 在 8 月 25 日的汇总中写到,Ox Alpha 对 50 条测试字符串的 token 计数与公开 GLM-5.3 50/50 匹配;四段视频的 token 预算与 GLM-5V-Turbo 一致;部分 Java/Spring 报错和业务码也与公开 GLM-5.3 后端逐字节相同。

几组线索互相呼应,但它们不是权重哈希。Turner 也说明,这些测量来自其他调查者,他没有在文章里重跑。Tokenizer 可以共用,视频编码器可以复用,Z.ai 服务器也能托管外部模型。所以比较稳的终点仍是“GLM 家族的多模态分支”,不是“破案成功”。

“GLM-5.2 的智慧加原生多模态”是什么意思

这句话听着像宣传语,拆开后其实是两个可核对的判断。

第一,标准 GLM-5.3 确实延续 GLM-5.2 的底座。Z.ai 把能力增益归因于长程编码、工具调用和真实任务环境上的后训练。它处理的是计划、行动、观察再继续的循环,我们在 Agentic Reasoning 指南里也解释过这类工作方式。

第二,Ox Alpha 的产品入口原生接受视觉输入。OpenRouter 列的是文本、图像、视频输入,并不是在外面再挂一个 OCR 工具。把它称为“原生多模态”对使用界面来说是准确的,但公开资料没有说明底层架构如何组合。

这样看,GLM-5.3 Flash 的猜测就有了来由:沿用 GLM-5.2/5.3 这一代的推理与 Agent 路线,再把视觉上下文放进同一个模型体验。至于 Flash 是否代表更快的服务档位,只是从名字做出的联想,不能算证据。

公开模型卡还有一个提醒。标准 GLM-5.3 是 1M 文本模型,GLM-5V-Turbo 是窗口更小的视觉模型,Ox Alpha 却是 1M 多模态入口。它像两者,但不等于任何一个公开产品。

网友测出来的数据到底能说明什么

Z.ai 给标准 GLM-5.3 公布了一组明显优于 GLM-5.2 的结果。这些数字解释了为什么一个可能的 5.3 分支会引起注意,却不能贴到 Ox Alpha 身上。

官方 benchmarkGLM-5.3GLM-5.2适用对象
Terminal Bench 3.028.34.6公开标准 GLM 模型
DeepSWE v1.166.946.2公开标准 GLM 模型
CyberGym84.577.2公开标准 GLM 模型
AutomationBench48.226.2公开标准 GLM 模型

Ox Alpha 的证据是另一套:

测试或反馈报告结果可以得出的结论局限
Wenqi/Kevin 的 DeepSWE 子集平均输出 47K token 时约 63%长程任务表现值得继续测个人子集,没有完整 prompt、任务数、harness 和代码
Cline 的真实仓库 bugOx 与 Fable 都修好,Ox 输出 token 约少 3 倍有一个简洁且正确的 Agent 输出案例单个未公开 bug,没有 raw token 表和重复运行
Reddit 的自行车 SVG评论者认可腿、道路、自行车和链条关系是个方便复现的视觉烟雾测试单图、非盲测、参数未知
Reddit 的定制语言游戏10 关游戏能运行,还加了 modulo;关卡设计一般有读取陌生文档并持续实现的迹象没有仓库、commit、完整 prompt 和测试日志

也别漏掉负面反馈。免费期涌入大量用户后,OpenCode 社区出现了过载、慢启动和上游 endpoint 错误。它更像预览服务的容量问题,不代表模型变笨,但会直接决定一次长 Agent 任务能不能跑完。

想找另一个百万上下文模型做参照,可以看 GPT-5.6 Sol 的 1M 上下文说明。两边都提醒了同一件事:窗口大小、产品默认值、费用和任务成功率是四个不同指标。

在 Tabbit 里把猜测变成自己的测试

Tabbit Browser 目前已经提供 GLM-5.3 Flash 模型页。匿名预览最麻烦的地方,是资料、prompt、截图和输出散落在不同网站与客户端。Tabbit 可以把这些东西留在同一个浏览器里比较。

Tabbit Browser 并排展示 GPT、Claude、Kimi、Qwen 与 GLM 的回答
Tabbit 可以让多个模型回答同一个 prompt。图中的 GLM-5.2 很适合拿来做 GLM-5.3 Flash 的基线。

一轮干净的测试分四步:

  1. 打开 GLM-5.3 Flash 模型页,先给一个成功条件明确的任务,保存 prompt 和输出。

  2. 在同一个浏览器里换成 GLM-5.2 或另一款模型,任务不变,只换模型。

  3. 加一张图片或截图,检查回答有没有真正用到画面细节,而不是复述题目。

  4. 多步骤网页任务再用 Agent Mode。只选公开、可回滚的任务,记录工具调用、重试、耗时和最终产物。

接入编码 harness 时也一样。我们的 DeepSeek Harness 浏览器指南会把浏览器控制和模型质量拆开看。Ox Alpha 也该这么测:好模型可能卡在拥堵路由上,重试做得好的客户端也可能只是在反复提交坏答案。

做资料研究,可以先把来源标签页附上,让模型在下结论前生成证据表。研究用 AI 浏览器工作流比把一堆 URL 扔进无记录聊天更容易复核。第一次用产品,可以先看 Tabbit 功能总览,里面讲了 @ 引用、多模型对话和 Agent Mode。

这里的取舍很简单。Tabbit 让 GLM-5.3 Flash 更容易调用和对比,但不会把社区归因变成官方模型卡。GLM-5.3-Flash 是当前产品入口,Ox Alpha = GLM-5.3-Flash 仍是待验证假设。

现在应该相信到哪一步

你要判断的问题当前答案原因
Ox Alpha 值得拿来做编码和 Agent 测试吗值得做受控测试已有几条具体正向反馈,但样本很小
它和 GLM 有关系吗大概率有多组独立指纹指向同一方向
它确定是 GLM-5.3 Flash 吗不能确定没有一手官宣、公开模型 ID 或权重匹配
63% 能当排行榜成绩吗不能它来自方法未完整公开的 DeepSWE 子集
能把敏感生产数据交给它吗匿名阶段不建议保留条款和运营者身份还不足以支撑合规结论
Tabbit 适合试用吗适合可回滚的文字、图片和网页任务模型入口、上下文和对比工作流都在同一浏览器里

谜底已经缩小到一个很实用的范围。Ox Alpha 表现得像 GLM 家族,服务栈也指向 Z.ai,还把百万上下文和多模态输入放在了一起。GLM-5.3 Flash 是目前最顺的名字,但仍然只是猜测。

任务合适就去用,顺手把证据留好。等 Z.ai 或 OpenRouter 真正公布 checkpoint,这篇文章也很好更新,因为事实和推论从头到尾没有混在一起。

常见问题

Ox Alpha 是什么模型?

Ox Alpha 是 OpenRouter 在 2026 年 8 月 21 日上线的匿名预览模型。公开规格包括 1,048,576 token 上下文、最高 131,072 token 输出,以及编码、持续 Agent 与生产任务定位。开发者和具体 checkpoint 尚未公布。

Ox Alpha 已经确定是 GLM-5.3 Flash 吗?

还没有。OpenRouter 和 Z.ai 都没有正式宣布 Ox Alpha 就是 GLM-5.3 Flash。社区指纹较强地指向 GLM-5.x 家族与 Z.ai 服务栈,但 Flash 仍是归因判断,不是官方产品身份。

为什么大家认为 Ox Alpha 属于 GLM?

社区调查者报告了三组线索:50 条字符串的 token 计数与 GLM-5.3 全部匹配,视频 token 预算接近 GLM-5V-Turbo,部分服务端报错与 Z.ai 的 GLM 后端一致。这些线索支持家族关系,但 tokenizer 和托管环境相同并不等于 checkpoint 相同。

Ox Alpha 支持多模态吗?

支持。OpenRouter 官方公告写明它接受文本、图像和视频输入,输出文本。这只能确认输入形态,不能替代视觉 benchmark,也没有公开视频长度上限和底层架构。

Ox Alpha 真的继承了 GLM-5.2 的能力吗?

Z.ai 明确表示公开版 GLM-5.3 与 GLM-5.2 使用同一个 base model,能力提升来自额外后训练。如果 Ox Alpha 确实是社区猜测的 GLM-5.3 Flash,这种说法有合理的技术来源;目前它还不是针对 Ox Alpha 的官方架构说明。

如何在 Tabbit 中使用 GLM-5.3 Flash?

打开 Tabbit 的 GLM-5.3 Flash 模型页,输入文字、图片或 Agent 任务,再选择在 Tabbit 中使用。建议保存 prompt 与输出,把身份猜测和任务结果分开判断;匿名预览阶段不要提交敏感代码、凭据或客户数据。

下一步

让 Tabbit 与你并肩工作。

跨标签页调研、自动化重复的浏览器工作,让每一处上下文都触手可及。