Binx 称 Ox Alpha 在一个此前 DeepSeek、Qwen、MiniMax 和 Sol 都未解决的 gauntlet 问题上,用一句话、约 10 秒完成了修复;这是一个强烈但不可复核的单案例信号。
任务:作者称为 gauntlet run 中的一项问题,但未公开仓库、issue、commit 或测试命令。
对照模型:DeepSeek、Qwen、MiniMax、Sol;版本和 harness 未公开。
Ox Alpha:帖子只称 stealth model,没有公开模型 ID、参数或工具权限。
耗时:作者称“one sentence. ten seconds”。
| 指标 | 帖文报告 | 边界 |
|---|---|---|
| 先前对照 | DeepSeek、Qwen、MiniMax、Sol 未解决 | 没有各自轨迹,可能存在环境/时段差异 |
| Ox Alpha 结果 | 成功解决该 issue | 没有 diff、测试或 reviewer 证据 |
| 交互/耗时 | 一句话、约 10 秒 | 质性描述,不是完整 wall-clock 计时 |
可把这个案例转化成“同一 issue 的多模型盲测”,但当前不能确认是模型能力、上下文状态、工具可用性或服务负载造成的差异。帖子没有公开足够数据,不应写成 Ox Alpha 普遍优于四个对照模型。
固定 gauntlet 的 commit、issue 描述、工具权限和每个模型的上下文初始状态。
记录每次首个有效工具调用、完成时间、完整 diff、测试结果和人工返工。
每个模型至少重复 3 次,并随机化运行顺序,避免服务时段偏差。
报告“首次解决率”和“修复后测试通过率”,不要只比较最终一句话长度。
Ox Alpha