Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
社区Ox Alpha

独立 LiveCodeBench v6:Ox Alpha 原始 Pass@1

原始来源

Reddit + GitHub 实验仓库

作者u/nasarulislam;仓库作者 xnasarx

原文日期2026-08-22

Tabbit 整理2026-08-27

查看原文

一句话结论

在无 agent、无工具、无 scaffold、temperature=0 的单轮代码生成协议下,实验仓库报告 Ox Alpha 在 LiveCodeBench release_v6 上 49/175、Pass@1=28.0%,难度越高通过率越低。

测试环境

  • 入口:OpenRouter stealth/ox-alpha,2026-08-21 的免费预览。

  • 数据集:LiveCodeBench code_generation_lite 的 test6.jsonl,release_v6,共 175 题。

  • 解码:greedy,temperature=0,每题一次尝试。

  • 模型输入:题目描述 + starter code,并要求返回一个 Python 代码块。

  • 执行:每个测试用例启动新 subprocess,stdin/stdout 比较并做 JSON 规范化;函数题使用参数解析和函数调用 wrapper。

  • 硬件:i5 / 8 GB RAM / 无 GPU;推理 100% 远程。

  • 可靠性:API 错误使用指数退避,每题有 checkpoint,可恢复运行。

原始结果

难度通过题数Pass@1
Easy224351.2%
Medium165230.8%
Hard118013.8%
Overall4917528.0%
  • Generation failures:0;175 次都生成了可执行代码。

  • 在线原始报告:https://xnasarx.github.io/ox-alpha-benchmarks/results/report.html

  • 可复现实验仓库:https://github.com/xnasarx/ox-alpha-benchmarks

  • 原始逐题结果:仓库 results/lcb/latest.json。

复现步骤

  1. 克隆仓库并固定 commit;检查 README.md、scripts/、oxbench/ 和 results/。

  2. 获取同一版 LiveCodeBench release_v6 数据,固定题目顺序、prompt wrapper、temperature=0 和每题一次尝试。

  3. 通过 OpenRouter 请求 stealth/ox-alpha,保存模型 ID、提供商、请求时间、响应、错误和 checkpoint。

  4. 在本地按仓库 evaluator 运行隐藏测试,输出逐题 passed/failed、难度汇总和生成失败数。

  5. 与已知版本模型比较时,必须使用相同题集、wrapper、超时、解码和执行环境。

结论与适用边界

这是一条比“看起来会写代码”更可复核的原始能力基线:它支持 Ox Alpha 在该协议下的单轮代码能力为 28.0%,并显示 Hard 题通过率为 13.8%。它不代表带工具、长上下文、反复修复或 agent Harness 下的真实开发能力。

局限

  • 只有一次单轮 greedy 结果,不能估计 Pass@k 或采样分布。

  • 代码仓库将 DeepSeek 的厂商结果并列展示,但这些数字不是同一实验协议,不能直接做严格排行榜。

  • 20 秒测试超时、温度和无 scaffold 适合复现 raw baseline,不等于最佳使用配置。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Ox Alpha

在 Tabbit 中使用并对比模型

Ox Alpha

相关测评

官方OpenRouter2026-08-21

OpenRouter 官方记录:Ox Alpha 的规格、可用性与匿名提供商

社区X2026-08-25

Cline 实测:Ox Alpha 与 Fable 在真实仓库 bug 上都修好,但输出 token 约少三倍

社区X2026-08-25

OpenCode 官方观测:四天 26T Ox Alpha tokens

社区X2026-08-21

OpenCode 官方 Go 入口:免费期与负载反馈

Ox Alpha

相关提示词

社区Reddit2026-08-21

SVG 视觉一致性烟雾测试:龙骑自行车

社区Reddit2026-08-22

自定义语言文档到平台游戏:长任务工作流

社区Reddit2026-08-25

OpenCode 中途卡住与上游错误:四步排障工作流

社区X2026-08-21

OpenCode 上的 Ox Alpha:长上下文与免费预览配置