Ox Alpha

Ox Alpha 模型测评导航

汇总 Ox Alpha 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。

14 条已核对来源的资料官方 · 媒体 · 社区

官方

1 条已核对来源的资料

社区

13 条已核对来源的资料
社区X

Cline 实测:Ox Alpha 与 Fable 在真实仓库 bug 上都修好,但输出 token 约少三倍

Cline 表示,在其仓库中的一个真实 bug 上,Ox Alpha 和 Fable 都正确完成修复;但 Ox Alpha 的输出 token 约少三倍、重复推理更少,这是一条值得复测的效率信号,而不是可推广到所有任务的能力排名。

社区X

OpenCode 官方观测:四天 26T Ox Alpha tokens

OpenCode 官方报告 Ox Alpha 在 4 天内处理了 26T tokens,证明预览被大量真实使用,但不能从总 token 量推导模型质量、个人配额或可用性。

社区X

OpenCode 官方 Go 入口:免费期与负载反馈

OpenCode 官方宣布 Ox Alpha 进入 OpenCode Go、未来 6 天近乎不限量且不计入 Go 用量;公开回复同时出现中途停止、约 20 tok/s 和过载反馈,说明入口便利性与服务稳定性必须分开评估。

社区X

Aniruddha 实测:代理工具调用与搜索任务体验

Aniruddha 称 Ox Alpha 的代理工具调用和基于搜索的功能很多,并表示其截至当时测试都很好;由于没有任务、轨迹和完成标准,这是一条待复测的工具使用体验。

社区X

Binx 实测:Gauntlet 中一次单句修复

Binx 称 Ox Alpha 在一个此前 DeepSeek、Qwen、MiniMax 和 Sol 都未解决的 gauntlet 问题上,用一句话、约 10 秒完成了修复;这是一个强烈但不可复核的单案例信号。

社区X

Matse 实测:一年代码库中的 Bug 与安全问题审查

Matse 称 Ox Alpha 在其一年积累的代码中、约 3 小时内发现了大量 Bug 和安全漏洞并解决了多个问题,但没有公开样本和修复证据,适合作为审计流程的候选而非性能结论。

社区X Article

Jonathan Turner 研究:Ox Alpha 的指纹对比与身份边界

这篇文章把 Ox Alpha 与公开 GLM、Gemini、DeepSeek、Kimi 和 MiMo 的 tokenizer、视频 token 预算和服务端错误做了对照,强烈指向“GLM 家族/ Z.ai 服务栈”,但明确不能据此命名具体产品或开发者。

社区Reddit + GitHub 实验仓库

独立 LiveCodeBench v6:Ox Alpha 原始 Pass@1

在无 agent、无工具、无 scaffold、temperature=0 的单轮代码生成协议下,实验仓库报告 Ox Alpha 在 LiveCodeBench releasev6 上 49/175、Pass@1=28.0%,难度越高通过率越低。

社区Reddit + GitHub 实验仓库

12 prompt 文风指纹实验:Ox Alpha 与 GLM 5.3 的相似性

在 11 个匹配 prompt、7 个参考模型和确定性的 460 特征文风协议下,Ox Alpha 每个 prompt 都最接近 GLM 5.3,但这只能说明测试条件下的风格相似,不能识别权重或开发者。

社区Reddit

OpenCode 社区并发实验:约 40 个 Ox Alpha agent

Ethan 报告在早期免费期同时运行约 40 个 Ox Alpha agent 时,每 worker 每小时约 7 个任务、P50 延迟 26.8 秒且代码引用 100% 可追溯;这是单一用户的负载观测,不是服务 SLA。

社区Reddit

Ox Alpha 与 DeepSeek V4 Flash:代码清理与 token 使用体验对照

一位 OpenCode 用户称 Ox Alpha 在其项目中清理 DeepSeek V4 Flash 的结果、用约五分之一 token 完成工作,但同一讨论也出现“逻辑/unsafe Rust/汇编更差”的反例,结论高度依赖任务类型。

社区X

同一提示跨日期输出波动:Ox Alpha 版本与服务栈不确定性

AditYah 称同一 prompt 三天后得到完全不同的代码结果,耗时从 80 分钟变为 330 分钟并生成 4,500+ 行代码;这更适合被当作服务路由、版本或采样波动的复现实验信号,而非持续学习证据。

社区X

同图像、同 prompt、三 Harness:Ox Alpha 的框架影响

LeMi 用同一个 Ox Alpha、同一张《星际穿越》Ranger RF-31D 参考图像和同一个 prompt 比较 DeepSeek、OMP、OpenCode 三个框架,说明 Harness 可能显著影响结果,但帖子没有公开可量化评分。

Ox Alpha

在 Tabbit 中使用并对比模型

汇总 Ox Alpha 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。