在无 agent、无工具、无 scaffold、temperature=0 的单轮代码生成协议下,实验仓库报告 Ox Alpha 在 LiveCodeBench release_v6 上 49/175、Pass@1=28.0%,难度越高通过率越低。
入口:OpenRouter stealth/ox-alpha,2026-08-21 的免费预览。
数据集:LiveCodeBench code_generation_lite 的 test6.jsonl,release_v6,共 175 题。
解码:greedy,temperature=0,每题一次尝试。
模型输入:题目描述 + starter code,并要求返回一个 Python 代码块。
执行:每个测试用例启动新 subprocess,stdin/stdout 比较并做 JSON 规范化;函数题使用参数解析和函数调用 wrapper。
硬件:i5 / 8 GB RAM / 无 GPU;推理 100% 远程。
可靠性:API 错误使用指数退避,每题有 checkpoint,可恢复运行。
| 难度 | 通过 | 题数 | Pass@1 |
|---|---|---|---|
| Easy | 22 | 43 | 51.2% |
| Medium | 16 | 52 | 30.8% |
| Hard | 11 | 80 | 13.8% |
| Overall | 49 | 175 | 28.0% |
Generation failures:0;175 次都生成了可执行代码。
在线原始报告:https://xnasarx.github.io/ox-alpha-benchmarks/results/report.html
原始逐题结果:仓库 results/lcb/latest.json。
克隆仓库并固定 commit;检查 README.md、scripts/、oxbench/ 和 results/。
获取同一版 LiveCodeBench release_v6 数据,固定题目顺序、prompt wrapper、temperature=0 和每题一次尝试。
通过 OpenRouter 请求 stealth/ox-alpha,保存模型 ID、提供商、请求时间、响应、错误和 checkpoint。
在本地按仓库 evaluator 运行隐藏测试,输出逐题 passed/failed、难度汇总和生成失败数。
与已知版本模型比较时,必须使用相同题集、wrapper、超时、解码和执行环境。
这是一条比“看起来会写代码”更可复核的原始能力基线:它支持 Ox Alpha 在该协议下的单轮代码能力为 28.0%,并显示 Hard 题通过率为 13.8%。它不代表带工具、长上下文、反复修复或 agent Harness 下的真实开发能力。
只有一次单轮 greedy 结果,不能估计 Pass@k 或采样分布。
代码仓库将 DeepSeek 的厂商结果并列展示,但这些数字不是同一实验协议,不能直接做严格排行榜。
20 秒测试超时、温度和无 scaffold 适合复现 raw baseline,不等于最佳使用配置。
Ox Alpha