OpenAI 将 GPT-6 Luna 定位为低成本、高吞吐模型,并报告其在 AutomationBench、DeepSWE 与 OSWorld 上相对前代的提升,但公开页未提供完整逐题数据和所有复现配置。
模型/入口:GPT-6 Luna;发布页同时报告不同 reasoning effort 档位。DeepSWE 报告使用 max effort。
基准:AutomationBench 1.0.6、DeepSWE v1.1、OSWorld 2.0 offline,以及内部事实性评估。
价格:每百万输入 token $0.10、输出 token $0.50;这是发布页列出的 API 价格。
对照:主要与 GPT-5.6 Luna 比较,部分任务还与 GPT-6 Sol、GPT-6 Astra 及 Claude 系列比较。
发布页描述 AutomationBench 为跨应用业务工作流,覆盖 47 种工具及销售、营销、运营、支持、财务和 HR;DeepSWE 是真实代码库中的长程软件工程任务;OSWorld 2.0 为日常及专业电脑操作工作流。
AutomationBench:GPT-6 Luna 在 high effort 下比 GPT-5.6 Luna 高 5.4 个百分点,官方称每任务成本低 58%。页面没有在正文表格中给出两者的精确绝对分数。
DeepSWE v1.1:GPT-6 Luna max 得分 66.6%,官方称与 Claude Opus 5、Fable 5 的 medium 档相近;每任务成本分别低 93% 和 96%。
OSWorld 2.0 offline:GPT-6 Luna max 超过 GPT-5.6 Sol medium,官方称成本约为其十分之一。
事实性:OpenAI 称 Luna 有明显改善;较高 effort 时可达到 GPT-5.6 Sol 的水平,约为其百分之一成本。该结果使用内部、经过去标识化且曾被用户标记为事实错误的 ChatGPT 对话。
官方说明其事实性数据不是典型使用分布,且未按答案长度控制。
官方数据支持把 Luna 纳入成本敏感的编码 Agent、跨应用工作流和电脑使用候选。具体任务仍需按自己的工具、提示、effort 档位和验收规则测试,不能把发布页的相对成本结论直接等同于固定生产账单。
这是模型厂商自报结果,不能替代独立复测。
发布页未公开所有 benchmark 的完整提示词、逐题结果、重复次数、置信区间和 harness 配置。
不同基准使用的 effort、工具和模型对照不同;跨基准分数不可直接比较。
AutomationBench 的 Claude Fable 5.1 成本未计入约 40% 任务上的 Opus 5 fallback,OpenAI 明确指出该成本被低估。
OSWorld、内部事实性结果来自特定数据集版本和筛选方式,不能外推为所有桌面任务或日常问答表现。
固定模型快照、API provider、reasoning effort、工具权限和各基准版本。
对照 GPT-5.6 Luna,在相同任务集和 harness 下分别重复运行 AutomationBench、DeepSWE 与 OSWorld。
保存原始输入、工具轨迹、逐题评分、完成状态、token、延迟和实际费用。
单独报告任务成功率、成本和人工交付质量;不要将不同基准的百分比合并成单一排名。
GPT-6 Luna