Google 索引显示,Rails 团队将 8 个模型放在 21 项原子任务上比较。摘要给出的 Luna 结果是:默认 medium reasoning 下 73% 的 runs 成功,63 次运行总成本约 90 美分,并被标为最便宜模型。
本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。
X 正文在 Tabbit 国际版中没有展开,本文只保存 Google 索引可见的原文摘要。缺少任务清单、成功判定、其他模型对应成本和运行环境,不能把 73% 当成通用 coding 通过率。
GPT-5.6 Luna