Artificial Analysis 的自有评测显示 GPT-6 Luna max 以显著更低任务成本取得接近前代的综合结果,但 Coding Agent Index 略有回退,GDPval 与 Briefcase 也出现知识工作交付质量问题。
模型/入口:GPT-6 Luna max 与 GPT-5.6 Luna max;文章也报告其他 effort 档位及模型作为比较。
基准:Artificial Analysis Intelligence Index v4.3、Coding Agent Index、AA-Omniscience、AutomationBench-AA、Terminal-Bench 4.0、GDPval-AA v2.1、AA-Briefcase v1.1、SWE-Atlas-QnA、DeepSWE v1.1。
Harness:编码 Agent 指标明确使用 OpenAI Codex harness;其余任务按各项基准的独立设置执行。
费用口径:每任务费用及 Artificial Analysis Intelligence Index 任务的加权成本;美元金额依文章采集时的模型价格与 token 消耗。
文章给出多个基准版本及部分成本、token 消耗、得分和任务结果,但没有在文章正文中发布全部逐题输入、原始产物和每个基准的完整运行配置。
Intelligence Index:文章称 GPT-6 Luna max 的分数与 GPT-5.6 Luna max 大致持平;Luna 每任务成本从 $0.18 降至 $0.07,约低 60%。两代 Luna 每任务输出 token 分别约 41k 和 51k。
Coding Agent Index:GPT-6 Luna max 为 41 分,比 GPT-5.6 Luna max 低 2 分;SWE-Atlas-QnA 从 49% 降至 44%,DeepSWE v1.1 从 66% 降至 64%。
AA-Omniscience:Luna max 幻觉率从 93% 降至 77%,准确率约从 43% 到 44%;文章说明 Luna 回答的问题变少。
AutomationBench-AA:Luna 从 50% 升至 53%。Terminal-Bench 4.0 从 12% 升至 13%。
GDPval-AA v2.1:文章报告 Luna 约下降 75 Elo;AA-Briefcase v1.1 约下降 45 Elo。作者检查数百份产物后,将退化归因于呈现质量变差、交付内容遗漏评分标准元素。
Luna max 的优势主要是低成本;编码 Agent 与知识工作场景并非全面进步。对结果需要覆盖完整要求、产物格式和质量标准的任务,应检查交付内容并运行独立验收,而不能只依据综合分或每 token 价格选型。
指标与任务集由 Artificial Analysis 设计或运营,不能视为全行业统一标准。
文章概述了版本、部分 harness 和结果,但未提供所有逐题输入及原始产物,复现程度有限。
文章报告的分数受具体模型档位、harness、输出长度与价格假设影响。
Intelligence Index 的混合结果不能直接预测单个团队的任务表现;文章也明确指出不同基准方向有升有降。
记录文章列出的基准版本、GPT-6 Luna max、GPT-5.6 Luna max 与 Codex harness 版本。
对 SWE-Atlas-QnA、DeepSWE、AutomationBench、Terminal-Bench 和知识工作任务分别固定同一任务集、工具和评分规则。
保存每题输入/输出、任务状态、token 数、费用及人工评分,特别标记交付遗漏与呈现质量。
逐项报告成功率和成本,避免把文章综合指标直接外推到不同 harness。
GPT-6 Luna