Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评
媒体GPT-6 Sol

GPT-6 Sol:Artificial Analysis 成本效率与幻觉测量

原始来源

Artificial Analysis

作者Artificial Analysis

原文日期2026-09-22

Tabbit 整理2026-09-22

查看原文

一句话结论

Artificial Analysis 的公开结果显示,GPT-6 Sol max 的 Intelligence Index 为 48、Coding Agent Index 为 57;前者任务成本约为 GPT-5.6 Sol max 的一半,Coding Agent Index 高 2 分。AA-Omniscience 幻觉率由 92% 降至 60%,但准确率也由 59% 降至 54%,且 Sol 回答的问题比例从 99% 降至 83%。

测试环境

  • Intelligence Index:v4.3,包含 10 项评测:AA-Briefcase、GDPval-AA v2、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。

  • Coding Agent Index:v1.5,包含 DeepSWE v1.1、Terminal-Bench 4.0、SWE-Atlas-QnA;文章明确说明该项使用 OpenAI Codex harness。

  • 推理档位:主要对照为 Sol 与 Luna 的 max 配置。

  • AA-Omniscience 口径:Index 奖励正确回答、惩罚幻觉,不惩罚拒答;分数范围 -100 至 100,0 表示正确数与错误数相当。Accuracy 是全量问题中完全正确的比例。Hallucination Rate 为 Incorrect / (Incorrect + Partial + Not Attempted)。

  • GDPval-AA v2.1:图表以 DeepSeek V4.1 Flash max 为 1600 Elo 锚点;分数是相对 Elo,不是百分比。

输入/配置

  • 文章对比 GPT-6 Sol max 与 GPT-5.6 Sol max,并在多项指标中同时给出 GPT-6 Luna max 与 GPT-5.6 Luna max。

  • 按百万 token 计价,Sol 输入/输出价格由 $4/$20 降至 $2/$10;Luna 由 $0.20/$1.20 降至 $0.10/$0.50。文章称两代缓存读取折扣均为 90%,缓存写入溢价均为 25%。

  • Intelligence Index 单任务成本来自 AA 评测任务的加权 token 消耗。文章称 Sol 平均每任务产生约 31K 输出 token,前代约 29K;Luna 约 51K,前代约 41K。

  • 文章没有公开完整提示词、采样参数、各评测重复次数或逐题运行轨迹。

结果数据

Intelligence Index 与成本

模型(max)Intelligence Index v4.3Index 单任务成本平均输出 token/任务
GPT-6 Sol48$1.06约 31K
GPT-5.6 Sol47$1.99约 29K
GPT-6 Luna37$0.07约 51K
GPT-5.6 Luna37$0.18约 41K

Coding Agent Index

模型(Codex harness,max)Index v1.5Coding Agent 单任务成本文章列出的组件结果
GPT-6 Sol57$2.99Terminal-Bench 4.0:43%;SWE-Atlas-QnA:58%
GPT-5.6 Sol55未列绝对值Terminal-Bench 4.0:37%;SWE-Atlas-QnA:54%
GPT-6 Luna41约为 GPT-5.6 Luna 的 40%(绝对值未列)SWE-Atlas-QnA:44%;DeepSWE v1.1:64%
GPT-5.6 Luna43基准对照SWE-Atlas-QnA:49%;DeepSWE v1.1:66%

文章另列 Intelligence Index 中的 Terminal-Bench 4.0:Sol 为 44% 对 40%,Luna 为 13% 对 12%。这是 Intelligence Index 的结果;Coding Agent Index 使用 Codex harness,数值应按各自评测设置理解,不能合并成单一分数。

AA-Omniscience 与其他组件评测

指标GPT-6 Sol maxGPT-5.6 Sol maxGPT-6 Luna maxGPT-5.6 Luna max
AA-Omniscience Index27221-10
完全正确率54%59%44%43%
幻觉率60%92%77%93%
尝试回答比例83%99%文章称减少回答,未列比例未列
AutomationBench-AA62%60%53%50%
Terminal-Bench 4.0(Intelligence Index)44%40%13%12%

文章还报告:GPT-6 Sol 与 GPT-5.6 Sol 在 GDPval-AA v2.1 相差约 100 Elo,Luna 与前代相差约 75 Elo;AA-Briefcase v1.1 中 Luna 约低 45 Elo,Sol 大致持平。文章没有在正文给出这些项目的绝对分数。

结论

  • 文章直接报告的结果:Sol 的 Intelligence Index 微升 1 分,单任务成本从 $1.99 降至 $1.06;Coding Agent Index 升 2 分至 57,文章列出的成本为 $2.99。Luna 的 Intelligence Index 持平,成本从 $0.18 降至 $0.07;Coding Agent Index 降 2 分至 41。

  • 文章对幻觉结果的解释:Sol 较少尝试回答,错误回答约减少四分之一,因此幻觉率降低;但准确率同时下降 5 个百分点。Luna 准确率大致持平,回答更少,幻觉率从 93% 降至 77%。低幻觉率不能单独解读为知识正确率提升。

  • 文章对知识工作回退的解释:Artificial Analysis 团队称其人工检查了数百份模型输出,认为 GDPval-AA 与 AA-Briefcase 的回退通常与呈现质量下降、交付物漏掉评分标准要求有关。这属于团队对结果的归因,不是表中独立量化的成因指标。

  • 成本前沿说法:作者将 Sol 的成本与 Coding Agent Index 组合解读为处于 Pareto 前沿;这是文章基于其比较模型集合的分析结论,不代表所有模型、价格或任务分布下的最低成本选择。

局限与复核

  • 文章公开的是 Artificial Analysis 的汇总测量,没有发布完整测试集、逐题提示词、运行轨迹、统计误差或各项重复次数,外部读者无法从本文独立重算总分。

  • 成本取决于该机构任务集中的 token 消耗与当时价格;实际工作负载的缓存命中、重试、工具开销和任务长度会改变账单。输入/输出单价减半不等于每种实际任务成本都恰好减半。

  • Coding Agent Index 结果绑定 Codex harness;不可直接推断为其他 Agent、工具链或无工具聊天的表现。

  • 复核时应分别对照 AA Intelligence Index v4.3、Coding Agent Index v1.5 与 AA-Omniscience 当前公开结果,并保留日期、推理档位和 harness;需要复现成本时,固定同一任务集并逐任务记录 token、成功情况及价格。本文没有材料支持复现 AA 的原始整套实验。

复核步骤

  1. 在 Artificial Analysis 上确认文章所述版本:Intelligence Index v4.3、Coding Agent Index v1.5、AA-Omniscience。

  2. 对照同为 max 的 GPT-6 与 GPT-5.6 Sol/Luna 配置,分别记录总分、组件分数、回答率、准确率、幻觉率和任务成本。

  3. 自行复测成本时,固定 harness、任务集与价格,逐任务记录输入/输出 token、缓存、重试和完成状态;该复测只能比较自有样本,不能替代 AA 未公开的原始测试集。

适用边界

  • 这组数据可用于比较所列 AA 版本、评测和 max 配置,不能直接代表其他推理档位、Agent harness 或真实业务任务。

  • Sol 的低幻觉率伴随更低回答率与准确率;对需要覆盖率的工作,应同时评估漏答和错误率。

  • AA 对知识工作回退原因的说明来自团队人工检查及解释;文章没有提供可独立验证的因果实验。

原始证据与数据

来源页面正文直接给出价格、任务成本、输出 token、Coding Agent Index 分数、组件评测变化及 Omniscience 指标;随文图表标明 Intelligence Index v4.3 的 10 项评测、Coding Agent Index v1.5 的 3 个基准,并展示准确率、幻觉率和 Elo 对照。本文将图表与正文中不同 harness 下的 Terminal-Bench 结果分开记录。

来源摘录或观察(仅做合规短引)

原文称两个新版本在若干评测上同时有进步和回退(“progress in some evaluations and regressions in others”)。因此,单看价格、综合指数或幻觉率都不足以推断所有任务上的整体质量。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GPT-6 Sol

在 Tabbit 中使用并对比模型

GPT-6 Sol

相关测评

官方OpenAI2026-09-22

GPT-6 Sol 官方发布基准与评测边界

媒体AI IQ2026-09-22

GPT-6 Sol AIIQ 模型档案与基准覆盖率

社区KillSwitch-Bench

GPT-6 Sol:KillSwitch-Bench 对抗语言编码代理基准

媒体Artificial Analysis2026-09

GPT-6 Sol:Artificial Analysis 六档配置横向数据

GPT-6 Sol

相关提示词

官方OpenAI Developers

GPT-6 Sol 官方 API 模型配置

官方OpenAI Developers

GPT-6 Sol 自主推进提示

官方OpenAI 官方发布说明2026-09-22

GPT-6 提示缓存优化工作流

官方OpenAI Developers

OpenAI 官方 GPT-6 异步工具调用工作流