发布页显示 GPT-6 Sol 在专业工作、编码与电脑操作任务上相较 GPT-5.6 Sol 有提升,并以较低的单任务成本接近或超过部分竞品结果。所有分数和成本均为 OpenAI 发布的数据,不能视为独立复现。
模型/档位:GPT-6 Sol、GPT-6 Luna;按任务分别报告 low、medium、high、xhigh、max 等 effort 档位。
AutomationBench 1.0.6:使用 47 个工具测跨销售、营销、运营、客服、财务和 HR 的端到端业务流程。
Agents’ Last Exam V1:长时程、具有经济价值的专业任务,覆盖 55 个子行业。
FrontierCode 1.1 Main:评估代码正确性及可合并性,包括测试质量、范围控制、代码风格和遵循代码库规范。
DeepSWE 1.1:真实代码库中的原创长时程软件工程任务。
OSWorld 2.0:采用 v2026.08.08 发布版的 offline 集 partial reward,测试日常和专业电脑操作工作流。
OpenAI 的 GPT 评测来自其研究环境或 API;生产版 ChatGPT 的系统提示和可用工具可能不同。竞品数据取自公开报告;Claude Fable 5 无分时使用 Fable 5.1 的分数。
| 基准/指标 | GPT-6 Sol 结果 | 官方对照与说明 |
|---|---|---|
| AutomationBench 1.0.6 | xhigh:33.2%,$0.27/任务 | Astra low:30.3%,成本为 Sol 的 3.9 倍;Claude Opus 5 max:26.9%,成本为 11.1 倍;Claude Fable 5.1 + Opus 5 fallback max:31.4%,成本超过 8.9 倍 |
| Agents’ Last Exam V1 | max:56.4% | 高于 Claude Opus 5 在该评测中的最高分;Sol 每任务成本低 60%。发布页未列 Opus 5 的分数和绝对成本 |
| FrontierCode 1.1 Main | 发布页称较 GPT-5.6 Sol 明显提升 | 发布页称可用远低成本匹配 Claude Fable 5.1 xhigh;该页正文未列精确分数或成本 |
| DeepSWE 1.1 | max:68.8% | Claude Fable 5 xhigh:69.9%;Sol 每任务成本约低 80% |
| OSWorld 2.0 offline partial reward | xhigh:60.5% | Claude Opus 5 medium:60.3%;Sol 每任务成本约低 80% |
| 内部事实性评测 | 相较 GPT-5.6 Sol 约少一半错误 | OpenAI 称可靠性接近 Astra、成本显著更低;错误诱发对话集不代表日常使用 |
OpenAI 另称:Luna 在 AutomationBench high 档较 GPT-5.6 Luna 提高 5.4 个百分点、每任务成本低 58%;在 DeepSWE max 档为 66.6%,与 Opus 5 和 Fable 5 medium 档相近,成本分别低 93% 和 96%;在 OSWorld,Luna max 超过 GPT-5.6 Sol medium,成本约为其十分之一。事实性部分还称,较高 effort 的 Luna 可达到 GPT-5.6 Sol 水平,成本约为其百分之一。
| 模型 | 输入价变化 | 输出价变化 |
|---|---|---|
| GPT-5.6 Sol → GPT-6 Sol | $4 → $2 | $20 → $10 |
| GPT-5.6 Luna → GPT-6 Luna | $0.20 → $0.10 | $1.20 → $0.50 |
这些结果支持将 GPT-6 Sol 纳入长时程编码、业务流程和电脑操作 Agent 的候选模型,并在任务预算中评估每任务成本。不同基准的任务、harness、档位和计分方式不同,不能横向合并成单一排名。发布页所述成本优势也不等同于相同业务任务中的实际成本节省。
所有结果均由 OpenAI 发布;页面没有提供足以独立重跑的完整任务样本、提示词、随机种子、每题轨迹和各基准完整 harness 配置。
Fable 5.1 + Opus 5 fallback 的 AutomationBench 数据遗漏约 40% 任务上发生的 Opus 5 fallback 成本,因此页面明确指出其成本被低估。
内部事实性测试取自经去标识化、且曾被用户标记为事实错误的 ChatGPT 对话;这是刻意构造的错误诱发集,不代表常见使用。分数未按答案长度控制;OpenAI 称其长度扫描显示影响很小。
编码欺骗评测刻意挑选诱发不诚实的任务,且 effort 固定为 maximum;发布页说明该评测不衡量日常使用中的失败率。不要将此类挑战集结果直接解释为日常发生率。
GPT 模型评测环境与正式 ChatGPT 产品可能因系统提示和工具不同而产生差异;竞品分数来自公开报告,比较条件不必然一致。
AutomationBench、Agents’ Last Exam、FrontierCode、DeepSWE 与 OSWorld 的成本和分数应按各自任务和版本理解;OSWorld 此处具体是 v2026.08.08 offline 集的 partial reward。
对照相同基准版本、模型档位、工具权限和 harness;若发布页未公开相应配置,将缺项列为不可复现条件。
对代表性业务任务保存输入、工具轨迹、输出、token、任务成本、耗时和人工修订量,多次运行并报告波动。
分别报告分数与成本;不要将官方相对成本比例当作本地部署或自有工作流的实测结果。
发布页正文给出 Agents’ Last Exam、DeepSWE、OSWorld、事实性和跨基准成本比较的明确数字;AutomationBench 图表在页面中提供 effort、分数和任务成本数据。FrontierCode 正文仅提供相对表现描述,没有可直接抄录的分数。本文保留这一披露边界,不填补未公布数值。
GPT-6 Sol