Ox Alpha

Ox Alpha · 测评与证据

Ox Alpha,哪些结论值得看?

按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。

这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。

编辑结论

编辑结论

OpenRouter 将 Ox Alpha 描述为面向编码、持续 Agent 工作和生产工作负载的推理模型,并列出免费、1,048,576 token 上下文、最多 131,072 token 输出以及文本/图像/视频输入;提供商只标为 Stealth,开发者仍匿名,页面没有公开可复现的能力基准。

OpenRouter · 查看证据

Cline 表示,在其仓库中的一个真实 bug 上,Ox Alpha 和 Fable 都正确完成修复;但 Ox Alpha 的输出 token 约少三倍、重复推理更少,这是一条值得复测的效率信号,而不是可推广到所有任务的能力排名。

X · 查看证据

在无 agent、无工具、无 scaffold、temperature=0 的单轮代码生成协议下,实验仓库报告 Ox Alpha 在 LiveCodeBench release_v6 上 49/175、Pass@1=28.0%,难度越高通过率越低。

Reddit + GitHub 实验仓库 · 查看证据

完整测评与相关内容

模型深度阅读

总览 · 简体中文

Ox Alpha 是什么:从匿名预览到 GLM-5.3-Flash

Ox Alpha 曾是 Z.ai GLM-5.3-Flash 的匿名预览名。本文核对公开规格、获取边界、预览时间线与安全测试方式。

精选证据

官方厂商自报

OpenRouter 官方记录:Ox Alpha 的规格、可用性与匿名提供商

OpenRouter 将 Ox Alpha 描述为面向编码、持续 Agent 工作和生产工作负载的推理模型,并列出免费、1,048,576 token 上下文、最多 131,072 token 输出以及文本/图像/视频输入;提供商只标为 Stealth,开发者仍匿名,页面没有公开可复现的能力基准。

来源OpenRouter
原文日期2026-08-21
采集未知

待验证:本次未能重新核实原文。

模型/版本
Ox Alpha
来源
https://openrouter.ai/stealth/ox-alpha
采集/复核
2026-09-20;动态来源未重新打开
Agent视觉生成推理成本
社区编辑分析

Cline 实测:Ox Alpha 与 Fable 在真实仓库 bug 上都修好,但输出 token 约少三倍

Cline 表示,在其仓库中的一个真实 bug 上,Ox Alpha 和 Fable 都正确完成修复;但 Ox Alpha 的输出 token 约少三倍、重复推理更少,这是一条值得复测的效率信号,而不是可推广到所有任务的能力排名。

来源X
原文日期2026-08-25
采集未知

待验证:本次未能重新核实原文。

模型/版本
Ox Alpha
来源
https://x.com/cline/status/2091995642201842015
采集/复核
2026-09-20;动态来源未重新打开
编程推理成本
社区独立测量

独立 LiveCodeBench v6:Ox Alpha 原始 Pass@1

在无 agent、无工具、无 scaffold、temperature=0 的单轮代码生成协议下,实验仓库报告 Ox Alpha 在 LiveCodeBench release_v6 上 49/175、Pass@1=28.0%,难度越高通过率越低。

来源Reddit + GitHub 实验仓库
原文日期2026-08-22
采集未知

待验证:本次未能重新核实原文。

模型/版本
Ox Alpha
来源
https://www.reddit.com/r/LLMDevs/comments/1vv4hmb/ox_alpha_livecodebench_v6/
采集/复核
2026-09-20;动态来源未重新打开
编程Agent
社区独立测量

同图像、同 prompt、三 Harness:Ox Alpha 的框架影响

LeMi 用同一个 Ox Alpha、同一张《星际穿越》Ranger RF-31D 参考图像和同一个 prompt 比较 DeepSeek、OMP、OpenCode 三个框架,说明 Harness 可能显著影响结果,但帖子没有公开可量化评分。

来源X
原文日期2026-08-26
采集未知

待验证:本次未能重新核实原文。

模型/版本
Ox Alpha
来源
https://x.com/LeMiMind/status/2092307287775846791
采集/复核
2026-09-20;动态来源未重新打开
编程Agent视觉生成writing

全部来源

全部来源

14 / 14
官方厂商自报

OpenRouter 官方记录:Ox Alpha 的规格、可用性与匿名提供商

OpenRouter 将 Ox Alpha 描述为面向编码、持续 Agent 工作和生产工作负载的推理模型,并列出免费、1,048,576 token 上下文、最多 131,072 token 输出以及文本/图像/视频输入;提供商只标为 Stealth,开发者仍匿名,页面没有公开可复现的能力基准。

来源OpenRouter
原文日期2026-08-21
采集未知

待验证:本次未能重新核实原文。

模型/版本
Ox Alpha
来源
https://openrouter.ai/stealth/ox-alpha
采集/复核
2026-09-20;动态来源未重新打开
Agent视觉生成推理成本
社区编辑分析

Cline 实测:Ox Alpha 与 Fable 在真实仓库 bug 上都修好,但输出 token 约少三倍

Cline 表示,在其仓库中的一个真实 bug 上,Ox Alpha 和 Fable 都正确完成修复;但 Ox Alpha 的输出 token 约少三倍、重复推理更少,这是一条值得复测的效率信号,而不是可推广到所有任务的能力排名。

来源X
原文日期2026-08-25
采集未知

待验证:本次未能重新核实原文。

模型/版本
Ox Alpha
来源
https://x.com/cline/status/2091995642201842015
采集/复核
2026-09-20;动态来源未重新打开
编程推理成本
社区独立测量

独立 LiveCodeBench v6:Ox Alpha 原始 Pass@1

在无 agent、无工具、无 scaffold、temperature=0 的单轮代码生成协议下,实验仓库报告 Ox Alpha 在 LiveCodeBench release_v6 上 49/175、Pass@1=28.0%,难度越高通过率越低。

来源Reddit + GitHub 实验仓库
原文日期2026-08-22
采集未知

待验证:本次未能重新核实原文。

模型/版本
Ox Alpha
来源
https://www.reddit.com/r/LLMDevs/comments/1vv4hmb/ox_alpha_livecodebench_v6/
采集/复核
2026-09-20;动态来源未重新打开
编程Agent
社区独立测量

同图像、同 prompt、三 Harness:Ox Alpha 的框架影响

LeMi 用同一个 Ox Alpha、同一张《星际穿越》Ranger RF-31D 参考图像和同一个 prompt 比较 DeepSeek、OMP、OpenCode 三个框架,说明 Harness 可能显著影响结果,但帖子没有公开可量化评分。

来源X
原文日期2026-08-26
采集未知

待验证:本次未能重新核实原文。

模型/版本
Ox Alpha
来源
https://x.com/LeMiMind/status/2092307287775846791
采集/复核
2026-09-20;动态来源未重新打开
编程Agent视觉生成writing
社区个人体验

OpenCode 官方观测:四天 26T Ox Alpha tokens

OpenCode 官方报告 Ox Alpha 在 4 天内处理了 26T tokens,证明预览被大量真实使用,但不能从总 token 量推导模型质量、个人配额或可用性。

来源X
原文日期2026-08-25
采集未知

待验证:本次未能重新核实原文。

模型/版本
Ox Alpha; exact snapshot follows the source
来源日期
2026-08-25
方法/客户端
Source-specific public post; client and provider conditions follow the source
编程Agent成本
社区个人体验

OpenCode 官方 Go 入口:免费期与负载反馈

OpenCode 官方宣布 Ox Alpha 进入 OpenCode Go、未来 6 天近乎不限量且不计入 Go 用量;公开回复同时出现中途停止、约 20 tok/s 和过载反馈,说明入口便利性与服务稳定性必须分开评估。

来源X
原文日期2026-08-21
采集未知

待验证:本次未能重新核实原文。

模型/版本
Ox Alpha; exact snapshot follows the source
来源日期
2026-08-21
方法/客户端
Source-specific public post; client and provider conditions follow the source
编程Agent稳定性
社区个人体验

Aniruddha 实测:代理工具调用与搜索任务体验

Aniruddha 称 Ox Alpha 的代理工具调用和基于搜索的功能很多,并表示其截至当时测试都很好;由于没有任务、轨迹和完成标准,这是一条待复测的工具使用体验。

来源X
原文日期2026-08-26
采集未知

待验证:本次未能重新核实原文。

模型/版本
Ox Alpha; exact snapshot follows the source
来源日期
2026-08-26
方法/客户端
Source-specific public post; client and provider conditions follow the source
Agent
社区个人体验

Binx 实测:Gauntlet 中一次单句修复

Binx 称 Ox Alpha 在一个此前 DeepSeek、Qwen、MiniMax 和 Sol 都未解决的 gauntlet 问题上,用一句话、约 10 秒完成了修复;这是一个强烈但不可复核的单案例信号。

来源X
原文日期2026-08-26
采集未知

待验证:本次未能重新核实原文。

模型/版本
Ox Alpha; exact snapshot follows the source
来源日期
2026-08-26
方法/客户端
Source-specific public post; client and provider conditions follow the source
能力
社区个人体验

Matse 实测:一年代码库中的 Bug 与安全问题审查

Matse 称 Ox Alpha 在其一年积累的代码中、约 3 小时内发现了大量 Bug 和安全漏洞并解决了多个问题,但没有公开样本和修复证据,适合作为审计流程的候选而非性能结论。

来源X
原文日期2026-08-26
采集未知

待验证:本次未能重新核实原文。

模型/版本
Ox Alpha; exact snapshot follows the source
来源日期
2026-08-26
方法/客户端
Source-specific public post; client and provider conditions follow the source
编程
社区编辑分析

Jonathan Turner 研究:Ox Alpha 的指纹对比与身份边界

这篇文章把 Ox Alpha 与公开 GLM、Gemini、DeepSeek、Kimi 和 MiMo 的 tokenizer、视频 token 预算和服务端错误做了对照,强烈指向“GLM 家族/ Z.ai 服务栈”,但明确不能据此命名具体产品或开发者。

来源X Article
原文日期2026-08-25
采集未知

待验证:本次未能重新核实原文。

模型/版本
Ox Alpha; exact snapshot follows the source
来源日期
2026-08-25
方法/客户端
Source-specific public post; client and provider conditions follow the source
推理成本稳定性
社区个人体验

12 prompt 文风指纹实验:Ox Alpha 与 GLM 5.3 的相似性

在 11 个匹配 prompt、7 个参考模型和确定性的 460 特征文风协议下,Ox Alpha 每个 prompt 都最接近 GLM 5.3,但这只能说明测试条件下的风格相似,不能识别权重或开发者。

来源Reddit + GitHub 实验仓库
原文日期2026-08-26
采集未知

待验证:本次未能重新核实原文。

模型/版本
Ox Alpha; exact snapshot follows the source
来源日期
2026-08-26
方法/客户端
Source-specific public post; client and provider conditions follow the source
推理writing
社区个人体验

OpenCode 社区并发实验:约 40 个 Ox Alpha agent

Ethan 报告在早期免费期同时运行约 40 个 Ox Alpha agent 时,每 worker 每小时约 7 个任务、P50 延迟 26.8 秒且代码引用 100% 可追溯;这是单一用户的负载观测,不是服务 SLA。

来源Reddit
原文日期2026-08-22
采集未知

待验证:本次未能重新核实原文。

模型/版本
Ox Alpha; exact snapshot follows the source
来源日期
2026-08-22
方法/客户端
Source-specific public post; client and provider conditions follow the source
编程Agent成本
社区编辑分析

Ox Alpha 与 DeepSeek V4 Flash:代码清理与 token 使用体验对照

一位 OpenCode 用户称 Ox Alpha 在其项目中清理 DeepSeek V4 Flash 的结果、用约五分之一 token 完成工作,但同一讨论也出现“逻辑/unsafe Rust/汇编更差”的反例,结论高度依赖任务类型。

来源Reddit
原文日期2026-08-22
采集未知

待验证:本次未能重新核实原文。

模型/版本
Ox Alpha; exact snapshot follows the source
来源日期
2026-08-22
方法/客户端
Source-specific public post; client and provider conditions follow the source
编程Agent成本
社区编辑分析

同一提示跨日期输出波动:Ox Alpha 版本与服务栈不确定性

Adit_Yah 称同一 prompt 三天后得到完全不同的代码结果,耗时从 80 分钟变为 330 分钟并生成 4,500+ 行代码;这更适合被当作服务路由、版本或采样波动的复现实验信号,而非持续学习证据。

来源X
原文日期2026-08-25
采集未知

待验证:本次未能重新核实原文。

模型/版本
Ox Alpha; exact snapshot follows the source
来源日期
2026-08-25
方法/客户端
Source-specific public post; client and provider conditions follow the source
编程稳定性writing

Ox Alpha

在 Tabbit 中比较 Ox Alpha

客户端中的模型、功能和权限以当前账户为准。