作者没有把模型压成一个总分,而是将其放进战略决策、仓库执行和代码修复等角色中测量。结果显示 Sol high 适合主战略会话,Sol medium 更快且消耗更少;在这套小样本执行测试中,Luna high/max 没有击败已有路线,甚至出现过度推理。
战略任务中,Luna max 得分 88,与 Terra max 并列,但低于 Sol high 94 和 Sol max 90。
仓库执行 brief:Sol high 93 分、80.73 秒、1,818 reasoning tokens;Sol medium 91 分、70.66 秒、779 tokens。
小型修复中 Luna high 4/4、52.59 秒;Luna max 4/4、121.34 秒,作者称其“heavily over-reasoned”。
最终路由没有给 Luna 固定席位,作者将 Luna 排除在主会话、审查和实现回滚路线之外。
作者明确说明:样本少、评测者知道模型身份、CLI 延迟混入、订阅消耗不等于 API token 成本,结果不能泛化。
本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。
GPT-5.6 Luna