GPT-5.6 Luna · 官方来源 · 厂商自报
这条证据围绕“GPT-5.6 Sol、Terra、Luna:Reddit 三档基准与路由建议”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
帖子汇总了三档模型的价格与多个 benchmark,并给出路由建议:Terra 作为多数工作负载默认模型,Sol 留给最难的 agent/terminal 任务,Luna 用于高频流水线。帖子同时引发了关于幻觉、订阅额度和“benchmark 是否代表真实体验”的讨论。
帖子原始价格:Sol $5/$30、Terra $2.50/$15、Luna $1/$6(每百万输入/输出 token;后续价格已有变化,不能当作当前价格)。
Terminal-Bench 2.1:Sol 88.8%、Terra 87.4%、Luna 84.7%。
AA Coding Agent Index:Sol 80、Terra 77.4、Luna 74.6。
DeepSWE value:帖子称 Luna 每 1 美元约 24 分,Opus 4.8 约 4.5 分。
讨论区有人指出,实际使用中 Sol 可能出现幻觉,也有人认为 Luna Max 接近 Sol Medium,但速度和效率不完全相同。
本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
Reddit,r/OpenAI · u/docdavkitty;链接文章署名为 the-agent-report.com · 原文发布日期 Unknown · 本站编辑日期 2026-09-20
打开原始来源GPT-5.6 Luna
下载 Tabbit 客户端后检查模型可用性