作者在“严格测试后的更正”中称 Codex 的 GPT-5.6 Luna Extra High 与 Terra High 性能相当,但 Luna 快约 1.3 倍、便宜约 2.5 倍;由于没有公开任务集和原始日志,这只能作为路由假设。
入口:Codex;作者讨论子代理额度和 Pro 计划使用量。
对照:GPT-5.6 Terra(High)与 GPT-5.6 Luna(Extra High)。
测试描述:作者只写“严格测试后的更正”,没有公开任务、代码库、样本数、时间窗口、snapshot、工具或计费明细。
原帖没有完整 prompt 或可下载测试包;可复用的配置假设是:把日常子代理从 Terra High 换成 Luna Extra High,并在同一类 Codex 任务上比较。
作者称性能基本相同。
作者称 Luna 比 Terra 快 1.3 倍。
作者称 Luna 比 Terra 便宜 2.5 倍;用于 Codex 子代理时,额度消耗约为 Terra 的 40%。
在成本敏感、任务可回退且有测试验收的 Codex 子代理中,Luna Extra High 值得作为 Terra High 的 A/B 候选;Terra 仍应保留给失败重试或复杂判断。该帖不能证明两者在所有任务上等价。
没有公开“性能相同”的判定指标、原始结果、样本规模、费用口径或统计不确定性。
“2.5 倍更少”可能指不同的订阅额度/计费规则,不等同 API token 价格。
Codex 产品路由、限额和模型 alias 会变化;需在当前账户和版本重新测量。
选取 20 个可独立验收的 Codex 子任务,固定代码库、工具、上下文和成功标准。
随机将任务分配到 Terra High 或 Luna Extra High,至少重复 3 轮。
记录首次通过率、修复轮次、延迟、token、账户额度消耗和人工质量分。
以任务类型分层报告;若 Luna 失败,记录升级到 Terra 的回退比例和最终成本。
GPT-5.6 Terra