GPT-5.6 Luna · 社区来源 · 个人体验
这条证据围绕“I benchmarked GPT-5.6 Sol/Luna/Terra by role:角色化测评”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
作者没有把模型压成一个总分,而是将其放进战略决策、仓库执行和代码修复等角色中测量。结果显示 Sol high 适合主战略会话,Sol medium 更快且消耗更少;在这套小样本执行测试中,Luna high/max 没有击败已有路线,甚至出现过度推理。
战略任务中,Luna max 得分 88,与 Terra max 并列,但低于 Sol high 94 和 Sol max 90。
仓库执行 brief:Sol high 93 分、80.73 秒、1,818 reasoning tokens;Sol medium 91 分、70.66 秒、779 tokens。
小型修复中 Luna high 4/4、52.59 秒;Luna max 4/4、121.34 秒,作者称其“heavily over-reasoned”。
最终路由没有给 Luna 固定席位,作者将 Luna 排除在主会话、审查和实现回滚路线之外。
作者明确说明:样本少、评测者知道模型身份、CLI 延迟混入、订阅消耗不等于 API token 成本,结果不能泛化。
本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
Reddit,r/LLMDevs · u/petburiraja · 原文发布日期 Unknown · 本站编辑日期 2026-09-20
打开原始来源GPT-5.6 Luna
下载 Tabbit 客户端后检查模型可用性