Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评
官方GPT-6 Sol

GPT-6 Sol 官方发布基准与评测边界

原始来源

OpenAI

作者OpenAI

原文日期2026-09-22

Tabbit 整理2026-09-22

查看原文

一句话结论

发布页显示 GPT-6 Sol 在专业工作、编码与电脑操作任务上相较 GPT-5.6 Sol 有提升,并以较低的单任务成本接近或超过部分竞品结果。所有分数和成本均为 OpenAI 发布的数据,不能视为独立复现。

测试环境与方法

  • 模型/档位:GPT-6 Sol、GPT-6 Luna;按任务分别报告 low、medium、high、xhigh、max 等 effort 档位。

  • AutomationBench 1.0.6:使用 47 个工具测跨销售、营销、运营、客服、财务和 HR 的端到端业务流程。

  • Agents’ Last Exam V1:长时程、具有经济价值的专业任务,覆盖 55 个子行业。

  • FrontierCode 1.1 Main:评估代码正确性及可合并性,包括测试质量、范围控制、代码风格和遵循代码库规范。

  • DeepSWE 1.1:真实代码库中的原创长时程软件工程任务。

  • OSWorld 2.0:采用 v2026.08.08 发布版的 offline 集 partial reward,测试日常和专业电脑操作工作流。

  • OpenAI 的 GPT 评测来自其研究环境或 API;生产版 ChatGPT 的系统提示和可用工具可能不同。竞品数据取自公开报告;Claude Fable 5 无分时使用 Fable 5.1 的分数。

结果数据

基准/指标GPT-6 Sol 结果官方对照与说明
AutomationBench 1.0.6xhigh:33.2%,$0.27/任务Astra low:30.3%,成本为 Sol 的 3.9 倍;Claude Opus 5 max:26.9%,成本为 11.1 倍;Claude Fable 5.1 + Opus 5 fallback max:31.4%,成本超过 8.9 倍
Agents’ Last Exam V1max:56.4%高于 Claude Opus 5 在该评测中的最高分;Sol 每任务成本低 60%。发布页未列 Opus 5 的分数和绝对成本
FrontierCode 1.1 Main发布页称较 GPT-5.6 Sol 明显提升发布页称可用远低成本匹配 Claude Fable 5.1 xhigh;该页正文未列精确分数或成本
DeepSWE 1.1max:68.8%Claude Fable 5 xhigh:69.9%;Sol 每任务成本约低 80%
OSWorld 2.0 offline partial rewardxhigh:60.5%Claude Opus 5 medium:60.3%;Sol 每任务成本约低 80%
内部事实性评测相较 GPT-5.6 Sol 约少一半错误OpenAI 称可靠性接近 Astra、成本显著更低;错误诱发对话集不代表日常使用

OpenAI 另称:Luna 在 AutomationBench high 档较 GPT-5.6 Luna 提高 5.4 个百分点、每任务成本低 58%;在 DeepSWE max 档为 66.6%,与 Opus 5 和 Fable 5 medium 档相近,成本分别低 93% 和 96%;在 OSWorld,Luna max 超过 GPT-5.6 Sol medium,成本约为其十分之一。事实性部分还称,较高 effort 的 Luna 可达到 GPT-5.6 Sol 水平,成本约为其百分之一。

API 价格(每百万 token)

模型输入价变化输出价变化
GPT-5.6 Sol → GPT-6 Sol$4 → $2$20 → $10
GPT-5.6 Luna → GPT-6 Luna$0.20 → $0.10$1.20 → $0.50

结果解读

这些结果支持将 GPT-6 Sol 纳入长时程编码、业务流程和电脑操作 Agent 的候选模型,并在任务预算中评估每任务成本。不同基准的任务、harness、档位和计分方式不同,不能横向合并成单一排名。发布页所述成本优势也不等同于相同业务任务中的实际成本节省。

局限

  • 所有结果均由 OpenAI 发布;页面没有提供足以独立重跑的完整任务样本、提示词、随机种子、每题轨迹和各基准完整 harness 配置。

  • Fable 5.1 + Opus 5 fallback 的 AutomationBench 数据遗漏约 40% 任务上发生的 Opus 5 fallback 成本,因此页面明确指出其成本被低估。

  • 内部事实性测试取自经去标识化、且曾被用户标记为事实错误的 ChatGPT 对话;这是刻意构造的错误诱发集,不代表常见使用。分数未按答案长度控制;OpenAI 称其长度扫描显示影响很小。

  • 编码欺骗评测刻意挑选诱发不诚实的任务,且 effort 固定为 maximum;发布页说明该评测不衡量日常使用中的失败率。不要将此类挑战集结果直接解释为日常发生率。

  • GPT 模型评测环境与正式 ChatGPT 产品可能因系统提示和工具不同而产生差异;竞品分数来自公开报告,比较条件不必然一致。

  • AutomationBench、Agents’ Last Exam、FrontierCode、DeepSWE 与 OSWorld 的成本和分数应按各自任务和版本理解;OSWorld 此处具体是 v2026.08.08 offline 集的 partial reward。

复现建议

  1. 对照相同基准版本、模型档位、工具权限和 harness;若发布页未公开相应配置,将缺项列为不可复现条件。

  2. 对代表性业务任务保存输入、工具轨迹、输出、token、任务成本、耗时和人工修订量,多次运行并报告波动。

  3. 分别报告分数与成本;不要将官方相对成本比例当作本地部署或自有工作流的实测结果。

原始证据与数据

发布页正文给出 Agents’ Last Exam、DeepSWE、OSWorld、事实性和跨基准成本比较的明确数字;AutomationBench 图表在页面中提供 effort、分数和任务成本数据。FrontierCode 正文仅提供相对表现描述,没有可直接抄录的分数。本文保留这一披露边界,不填补未公布数值。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GPT-6 Sol

在 Tabbit 中使用并对比模型

GPT-6 Sol

相关测评

媒体Artificial Analysis2026-09-22

GPT-6 Sol:Artificial Analysis 成本效率与幻觉测量

媒体AI IQ2026-09-22

GPT-6 Sol AIIQ 模型档案与基准覆盖率

社区KillSwitch-Bench

GPT-6 Sol:KillSwitch-Bench 对抗语言编码代理基准

媒体Artificial Analysis2026-09

GPT-6 Sol:Artificial Analysis 六档配置横向数据

GPT-6 Sol

相关提示词

官方OpenAI Developers

GPT-6 Sol 官方 API 模型配置

官方OpenAI Developers

GPT-6 Sol 自主推进提示

官方OpenAI 官方发布说明2026-09-22

GPT-6 提示缓存优化工作流

官方OpenAI Developers

OpenAI 官方 GPT-6 异步工具调用工作流