GPT-5.6 Luna · 社区来源 · 编辑分析
这条证据围绕“Agents on Rails:8 个模型、21 项原子任务”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
Google 索引显示,Rails 团队将 8 个模型放在 21 项原子任务上比较。摘要给出的 Luna 结果是:默认 medium reasoning 下 73% 的 runs 成功,63 次运行总成本约 90 美分,并被标为最便宜模型。
本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。
X 正文在 Tabbit 国际版中没有展开,本文只保存 Google 索引可见的原文摘要。缺少任务清单、成功判定、其他模型对应成本和运行环境,不能把 73% 当成通用 coding 通过率。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
X · @rails(Ruby on Rails) · 原文发布日期 Unknown · 本站编辑日期 2026-09-20
打开原始来源GPT-5.6 Luna
下载 Tabbit 客户端后检查模型可用性