Artificial Analysis 的公开结果显示,GPT-6 Sol max 的 Intelligence Index 为 48、Coding Agent Index 为 57;前者任务成本约为 GPT-5.6 Sol max 的一半,Coding Agent Index 高 2 分。AA-Omniscience 幻觉率由 92% 降至 60%,但准确率也由 59% 降至 54%,且 Sol 回答的问题比例从 99% 降至 83%。
Intelligence Index:v4.3,包含 10 项评测:AA-Briefcase、GDPval-AA v2、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。
Coding Agent Index:v1.5,包含 DeepSWE v1.1、Terminal-Bench 4.0、SWE-Atlas-QnA;文章明确说明该项使用 OpenAI Codex harness。
推理档位:主要对照为 Sol 与 Luna 的 max 配置。
AA-Omniscience 口径:Index 奖励正确回答、惩罚幻觉,不惩罚拒答;分数范围 -100 至 100,0 表示正确数与错误数相当。Accuracy 是全量问题中完全正确的比例。Hallucination Rate 为 Incorrect / (Incorrect + Partial + Not Attempted)。
GDPval-AA v2.1:图表以 DeepSeek V4.1 Flash max 为 1600 Elo 锚点;分数是相对 Elo,不是百分比。
文章对比 GPT-6 Sol max 与 GPT-5.6 Sol max,并在多项指标中同时给出 GPT-6 Luna max 与 GPT-5.6 Luna max。
按百万 token 计价,Sol 输入/输出价格由 $4/$20 降至 $2/$10;Luna 由 $0.20/$1.20 降至 $0.10/$0.50。文章称两代缓存读取折扣均为 90%,缓存写入溢价均为 25%。
Intelligence Index 单任务成本来自 AA 评测任务的加权 token 消耗。文章称 Sol 平均每任务产生约 31K 输出 token,前代约 29K;Luna 约 51K,前代约 41K。
文章没有公开完整提示词、采样参数、各评测重复次数或逐题运行轨迹。
| 模型(max) | Intelligence Index v4.3 | Index 单任务成本 | 平均输出 token/任务 |
|---|---|---|---|
| GPT-6 Sol | 48 | $1.06 | 约 31K |
| GPT-5.6 Sol | 47 | $1.99 | 约 29K |
| GPT-6 Luna | 37 | $0.07 | 约 51K |
| GPT-5.6 Luna | 37 | $0.18 | 约 41K |
| 模型(Codex harness,max) | Index v1.5 | Coding Agent 单任务成本 | 文章列出的组件结果 |
|---|---|---|---|
| GPT-6 Sol | 57 | $2.99 | Terminal-Bench 4.0:43%;SWE-Atlas-QnA:58% |
| GPT-5.6 Sol | 55 | 未列绝对值 | Terminal-Bench 4.0:37%;SWE-Atlas-QnA:54% |
| GPT-6 Luna | 41 | 约为 GPT-5.6 Luna 的 40%(绝对值未列) | SWE-Atlas-QnA:44%;DeepSWE v1.1:64% |
| GPT-5.6 Luna | 43 | 基准对照 | SWE-Atlas-QnA:49%;DeepSWE v1.1:66% |
文章另列 Intelligence Index 中的 Terminal-Bench 4.0:Sol 为 44% 对 40%,Luna 为 13% 对 12%。这是 Intelligence Index 的结果;Coding Agent Index 使用 Codex harness,数值应按各自评测设置理解,不能合并成单一分数。
| 指标 | GPT-6 Sol max | GPT-5.6 Sol max | GPT-6 Luna max | GPT-5.6 Luna max |
|---|---|---|---|---|
| AA-Omniscience Index | 27 | 22 | 1 | -10 |
| 完全正确率 | 54% | 59% | 44% | 43% |
| 幻觉率 | 60% | 92% | 77% | 93% |
| 尝试回答比例 | 83% | 99% | 文章称减少回答,未列比例 | 未列 |
| AutomationBench-AA | 62% | 60% | 53% | 50% |
| Terminal-Bench 4.0(Intelligence Index) | 44% | 40% | 13% | 12% |
文章还报告:GPT-6 Sol 与 GPT-5.6 Sol 在 GDPval-AA v2.1 相差约 100 Elo,Luna 与前代相差约 75 Elo;AA-Briefcase v1.1 中 Luna 约低 45 Elo,Sol 大致持平。文章没有在正文给出这些项目的绝对分数。
文章直接报告的结果:Sol 的 Intelligence Index 微升 1 分,单任务成本从 $1.99 降至 $1.06;Coding Agent Index 升 2 分至 57,文章列出的成本为 $2.99。Luna 的 Intelligence Index 持平,成本从 $0.18 降至 $0.07;Coding Agent Index 降 2 分至 41。
文章对幻觉结果的解释:Sol 较少尝试回答,错误回答约减少四分之一,因此幻觉率降低;但准确率同时下降 5 个百分点。Luna 准确率大致持平,回答更少,幻觉率从 93% 降至 77%。低幻觉率不能单独解读为知识正确率提升。
文章对知识工作回退的解释:Artificial Analysis 团队称其人工检查了数百份模型输出,认为 GDPval-AA 与 AA-Briefcase 的回退通常与呈现质量下降、交付物漏掉评分标准要求有关。这属于团队对结果的归因,不是表中独立量化的成因指标。
成本前沿说法:作者将 Sol 的成本与 Coding Agent Index 组合解读为处于 Pareto 前沿;这是文章基于其比较模型集合的分析结论,不代表所有模型、价格或任务分布下的最低成本选择。
文章公开的是 Artificial Analysis 的汇总测量,没有发布完整测试集、逐题提示词、运行轨迹、统计误差或各项重复次数,外部读者无法从本文独立重算总分。
成本取决于该机构任务集中的 token 消耗与当时价格;实际工作负载的缓存命中、重试、工具开销和任务长度会改变账单。输入/输出单价减半不等于每种实际任务成本都恰好减半。
Coding Agent Index 结果绑定 Codex harness;不可直接推断为其他 Agent、工具链或无工具聊天的表现。
复核时应分别对照 AA Intelligence Index v4.3、Coding Agent Index v1.5 与 AA-Omniscience 当前公开结果,并保留日期、推理档位和 harness;需要复现成本时,固定同一任务集并逐任务记录 token、成功情况及价格。本文没有材料支持复现 AA 的原始整套实验。
在 Artificial Analysis 上确认文章所述版本:Intelligence Index v4.3、Coding Agent Index v1.5、AA-Omniscience。
对照同为 max 的 GPT-6 与 GPT-5.6 Sol/Luna 配置,分别记录总分、组件分数、回答率、准确率、幻觉率和任务成本。
自行复测成本时,固定 harness、任务集与价格,逐任务记录输入/输出 token、缓存、重试和完成状态;该复测只能比较自有样本,不能替代 AA 未公开的原始测试集。
这组数据可用于比较所列 AA 版本、评测和 max 配置,不能直接代表其他推理档位、Agent harness 或真实业务任务。
Sol 的低幻觉率伴随更低回答率与准确率;对需要覆盖率的工作,应同时评估漏答和错误率。
AA 对知识工作回退原因的说明来自团队人工检查及解释;文章没有提供可独立验证的因果实验。
来源页面正文直接给出价格、任务成本、输出 token、Coding Agent Index 分数、组件评测变化及 Omniscience 指标;随文图表标明 Intelligence Index v4.3 的 10 项评测、Coding Agent Index v1.5 的 3 个基准,并展示准确率、幻觉率和 Elo 对照。本文将图表与正文中不同 harness 下的 Terminal-Bench 结果分开记录。
原文称两个新版本在若干评测上同时有进步和回退(“progress in some evaluations and regressions in others”)。因此,单看价格、综合指数或幻觉率都不足以推断所有任务上的整体质量。
GPT-6 Sol