Ox Alpha 就是 GLM-5.3-Flash。8 月 27 日,名字终于和过去一周的匿名模型对上了。在身份公开之前,它已经通过 OpenRouter 跑过真实仓库、图片、视频和很长的 Agent 任务。
一位开发者在 RandomAI 的视频下留言,说自己用 Ox Alpha 在单次会话里完成了整个版本升级工作流。这是一条个人体验,不是 benchmark。它解释了这次揭晓为什么有人在意:大家不是围着一个模型名猜参数,很多人已经拿它干活了。
GLM-5.3-Flash 延续 GLM-5.2 与标准 GLM-5.3 的智能路线,再加上原生多模态。现在可以在 Tabbit Browser 里选择它,让模型直接看你正在看的页面、图片或文件。
关键结论
Ox Alpha 在 2026 年 8 月 20 日出现在 OpenRouter,100 万 token 上下文,匿名提供方,内测期免费。
它原生接受文本、图片和视频,主要用于编码与长程 Agent。普通聊天只是更轻的用法。
8 月 27 日揭晓前,研究者已经通过 tokenizer、视频 token 预算和 Z.ai 风格错误码把范围收窄到 GLM 家族。
早期测评值得看,但不是整齐的总榜。DeepSWE 子集和 Cline 单仓库对照都只能回答各自的问题。
GLM-5.3-Flash 已进入 Tabbit 的 Chat 与 Agent 工作流。页面、截图、文档和浏览器操作混在一起时,它最有用。
Ox Alpha 时间线
| 日期 | 公开了什么 | 当时能得出什么结论 |
|---|---|---|
| 8 月 20 日 | OpenRouter 上线 Ox Alpha,标注为匿名第三方预览 | 模型真实存在,有 1M 上下文,面向编码与长任务;开发者未知 |
| 8 月 21 日 | OpenRouter 官方 X 写明文本、图片和视频输入 | API 表面是原生多模态,仍不能判断实验室 |
| 8 月 21 至 25 日 | tokenizer、视频 token、服务错误和社区测试陆续出现 | GLM 成为最强家族归因,但家族指纹不等于正式产品名 |
| 8 月 25 日 | Di Zhang 直接写出 GLM-5.3-Flash from Zhipu | exact name 进入公开讨论,当时仍是社区来源 |
| 8 月 27 日 | Ox Alpha 揭晓为 GLM-5.3-Flash | 代号和产品身份终于合上;旧测评成为 Flash 的内测证据,原有限制仍然保留 |
顺序不能倒过来写。8 月 23 日,TechCrunch 还在同时记录 GLM 和微软 MAI 等猜测。那几天确实没人能把答案写死。
这场匿名内测为什么有意思
OpenRouter 对 Ox Alpha 的描述很具体:reasoning model,面向 coding、持续 Agent 工作和生产负载;上下文 1,048,576 token,最大输出 131,072 token。预览期免费,背后只有一家匿名提供方。
匿名拿走了最省事的品牌判断。用户不能因为它叫 GLM、Claude 或 GPT 就先入为主,只能看任务有没有做完。当然,公开体验不会因此自动变成科学实验,但这一周的反馈确实比普通发布会更接近真实使用。
模型页还有一条不太适合写进宣传海报的事实:提供方会保留 prompt 和 completion,但声称不用于训练。测试私有代码前仍要读 stealth 条款。免费不能替代脱敏。
页面上的延迟、吞吐和可用性是动态服务数据。流量一变,数字就会变。它们不能写成模型固定速度,内测免费也不能写成永久价格。
X 和 Google 怎么一步步接近答案
最好用的线索不是模型自我介绍,而是它很难靠一句 system prompt 伪装的行为。Jonathan Turner 在 8 月 26 日的长文 汇总了几组独立测试:
| 信号 | 公开结果 | 能说明什么 | 单独不能说明什么 |
|---|---|---|---|
| Tokenizer | Ox Alpha 与公开 GLM-5.3 在 50 个字符串上 50/50 一致 | 很像 GLM-5.x 词表,外加 stealth wrapper | exact weights 或正式 SKU |
| 视频 token 预算 | 4 段视频逐段匹配 GLM-5V-Turbo | 很像 GLM-V 视觉编码器 | 它就是公开的 GLM-5V-Turbo |
| 服务端错误 | Java 包路径与业务错误码匹配 Z.ai PaaS v4 / GLM-5.3 | 服务跑在 Z.ai 风格后端 | 后训练每一步由谁完成 |
| 产品卡 | Ox 是 1M + 视觉;公开 5.3 是文本,5V-Turbo 是 200K | 更像未发布的多模态 GLM-5.x 兄弟型号 | 最终名字 |
Google 搜索结果也跟着调查变化。最初是「谁做了 Ox Alpha」,后来 PAA 直接出现「OxAlpha 是不是智谱 GLM-5.3-Flash」。Reddit 标题开始喊 confirmed,X 上仍有人猜 MiMo、MAI 或其他模型。搜索把争论收集起来,但没替大家判案。
Turner 当时的措辞很克制:家族像 GLM,服务栈像 Z.ai,具体产品名仍未知。随后 Di Zhang 把 exact name 写了出来。8 月 27 日,最后一个空格被填上。
GLM-5.2 的智慧,加上原生多模态
Z.ai 的 GLM-5.3 技术文章 明确写道,标准 GLM-5.3 与 GLM-5.2 使用相同基座。能力提升来自又一个月的规模化后训练:更多可执行环境、更长更多样的任务,以及投入这些轨迹的更多训练算力。
所以「继承 GLM-5.2 的智慧」不是一句玄学。它指向同一个基座与长程训练路线。标准 GLM-5.3 又把编码、工具调用和 Agent 任务推得更远。想先理解上一代,可看 Tabbit 中的 GLM-5.2 和 GLM-5.1 使用路径。
GLM-5.3-Flash 的变化是把原生多模态放进这条路线。Ox Alpha 内测时,同一路由可以接收文本、图片和视频。碰到半视觉任务时,它能先看截图、核对 UI,再继续读规格、代码或文档,不必把视觉理解拆给另一个模型。
但别把标准 GLM-5.3 的分数直接贴到 Flash 身上。Z.ai 公布的 DeepSWE v1.1 66.9、Terminal-Bench 3.0 28.3 等数据属于标准 5.3,而且是厂商在公开说明的 harness 下自报。它们是家族基线,不是 Flash 独立成绩。
网友测评到底说明了什么
目前最值得保留的两组测试,都给了具体任务或数字。
Wenqi/Kevin 报告,Ox Alpha 在一个 DeepSWE 子集上约 63%,平均每个任务输出约 47K token。他把它评价为开源模型中的 Pareto 前沿。帖子没有公开完整任务列表、重复次数和标准榜单提交,所以更准确的结论是:这是一个不错的编码 Agent 信号。
Cline 用自己仓库里的一个真实 bug 对比 Ox Alpha 和 Fable。两个模型都修好了。Cline 称 Ox Alpha 更少重复推理,在相近工作量下输出 token 约少三倍。一次正确修复排不了总榜,但它指出了一个很实用的特点:得出结论后开始行动,不把同一句根因说七遍。
YouTube 评论区那条「单会话完成整个版本升级」提供了第三种信号:长任务的连续性。没有仓库、diff 和测试日志,它不能证明成功率,只能说明为什么用户愿意在内测期间投入大量 token。
这三条反馈都符合长程后训练的方向。判断这类模型,重点不是第一句答得多漂亮,而是它能不能把任务做到收尾。想了解 Chat 与 Agent 循环的区别,可以看 Agentic reasoning 指南。如果你关心角色扮演与 preset,请转到独立的 GLM-5.3 SillyTavern 指南,那是另一种负载。
在 Tabbit 中使用 GLM-5.3-Flash
Tabbit 很适合承接这个模型,因为多模态上下文本来就在浏览器里。你不用先下载图片、复制网页,再去另一个聊天窗口重建任务。
打开 Tabbit Browser。分析用 Chat,多步网页任务用 Agent Mode。
在模型选择器里选择 GLM-5.3-Flash。
输入
@,引用当前页面、标签组、截图或本地文件。写清交付物和检查项。Agent 任务还要说明什么算完成、哪些内容不能改。

第一次可以给它一个混合但有边界的任务:附上产品截图和对应规格页,让 Flash 列出不一致,再让 Agent Mode 逐页核对。做研究也一样,把报告和实时来源放进标签组;研究型浏览器指南 有完整做法。
边界也很清楚。Tabbit 不是 IDE 里的 coding harness,选择模型也不等于永久拥有内测期的无限额度。当前限额看 Tabbit 价格。工作完全在代码仓库里,coding agent 更合适;证据散在网页、图片和文件中,浏览器才是 Flash 原生多模态最顺手的环境。
哪些任务适合 GLM-5.3-Flash
| 任务 | 适合度 | 怎么用 | 边界 |
|---|---|---|---|
| 对照 UI 截图与网页规格 | 高 | @ 两份材料,先出差异表,再让 Agent 核对 | 要求保留来源和视觉证据 |
| 跨网页、图表和 PDF 的长研究 | 高 | 资料放进标签组,要求带引用总结 | 不要只要一篇没有出处的长答案 |
| 需要识别页面视觉状态的浏览器流程 | 高 | 独立标签组运行,模型边看边做 | 写清停止条件,复核修改 |
| 大仓库补丁 | 一般 | Tabbit 看文档和截图,代码修改与测试留在 coding harness | 浏览器不替代 git 和 CI |
| 普通文字问答 | 可用但未必必要 | 不挂附件直接 Chat | 小模型可能更快 |
| 需要永久免费的 endpoint | 不适合这样假设 | 看当前模型选择器和套餐 | Ox Alpha 免费只是预览条件 |
结论不需要喊得很大。GLM-5.3-Flash 真正有意思的地方,是 GLM 一脉的长程推理碰上了视觉上下文。现有测试足以支持拿真实 Agent 任务试一试,不足以把标准 5.3 的全部分数复制过来,也不足以宣布它在所有场景第一。
任务从网页、截图、PDF 或浏览器操作开始,就在 Tabbit 里选择 GLM-5.3-Flash,并给它一条明确的终点线。如果你想拿它和百万上下文的 coding model 横向理解,可以继续看 GPT-5.6 Sol 上下文指南。
常见问题
Ox Alpha 真的是 GLM-5.3-Flash 吗?
是。2026 年 8 月 27 日,Ox Alpha 的身份揭晓为 GLM-5.3-Flash。在此之前,OpenRouter 只把它列为匿名的 stealth/ox-alpha;独立研究者已经从 tokenizer、视频 token 预算和服务端错误,把范围收窄到 GLM 家族与 Z.ai 服务栈。
GLM-5.3-Flash 和标准 GLM-5.3 是同一个模型吗?
不是。标准 GLM-5.3 是面向编码和长程 Agent 的文本模型。GLM-5.3-Flash 延续这条智能路线,并原生接受文本、图片和视频。除非 Flash 在相同条件下独立运行,否则不能把标准 5.3 的分数直接搬给 Flash。
GLM-5.3-Flash 从 GLM-5.2 继承了什么?
Z.ai 表示标准 GLM-5.3 与 GLM-5.2 使用同一个基座,提升来自规模化后训练,重点是编码、工具使用和长程任务。GLM-5.3-Flash 把这条智能路线与原生多模态输入组合在一起,而不是给文本模型临时外挂视觉模块。
Ox Alpha 内测时支持哪些输入?
OpenRouter 模型页和官方 X 帖显示,它有 100 万 token 上下文,支持文本、图片和视频输入,输出文本。它被定位为编码、持续 Agent 工作和生产任务模型。内测时的免费价格与限额不等于 GLM-5.3-Flash 的永久条款。
Ox Alpha 的早期测评成绩怎么样?
信号很好,但证据不完整。Wenqi/Kevin 报告 DeepSWE 子集约 63%,平均输出约 47K token;Cline 报告一个真实仓库 bug 两个模型都修好,而 Ox Alpha 输出 token 约少三倍。两组数据都不能替代完整独立榜单。
怎么在 Tabbit 里使用 GLM-5.3-Flash?
打开 Tabbit Browser,在 Chat 或 Agent 任务中选择 GLM-5.3-Flash。如果任务需要页面或视觉上下文,输入 @ 引用当前标签页、标签组、截图或本地文件。模型可用性和套餐限额会变化,请以当前选择器与 Tabbit 价格页为准。