Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评
媒体GPT-6 Luna

Artificial Analysis 独立评测:GPT-6 Luna 的成本、智能与编码结果

原始来源

Artificial Analysis / GPT-6 Sol and Luna push the cost efficiency frontier

作者Artificial Analysis

原文日期2026-09-22

Tabbit 整理2026-09-22

查看原文

一句话结论

Artificial Analysis 的自有评测显示 GPT-6 Luna max 以显著更低任务成本取得接近前代的综合结果,但 Coding Agent Index 略有回退,GDPval 与 Briefcase 也出现知识工作交付质量问题。

测试环境

  • 模型/入口:GPT-6 Luna max 与 GPT-5.6 Luna max;文章也报告其他 effort 档位及模型作为比较。

  • 基准:Artificial Analysis Intelligence Index v4.3、Coding Agent Index、AA-Omniscience、AutomationBench-AA、Terminal-Bench 4.0、GDPval-AA v2.1、AA-Briefcase v1.1、SWE-Atlas-QnA、DeepSWE v1.1。

  • Harness:编码 Agent 指标明确使用 OpenAI Codex harness;其余任务按各项基准的独立设置执行。

  • 费用口径:每任务费用及 Artificial Analysis Intelligence Index 任务的加权成本;美元金额依文章采集时的模型价格与 token 消耗。

输入/配置

文章给出多个基准版本及部分成本、token 消耗、得分和任务结果,但没有在文章正文中发布全部逐题输入、原始产物和每个基准的完整运行配置。

结果数据

  • Intelligence Index:文章称 GPT-6 Luna max 的分数与 GPT-5.6 Luna max 大致持平;Luna 每任务成本从 $0.18 降至 $0.07,约低 60%。两代 Luna 每任务输出 token 分别约 41k 和 51k。

  • Coding Agent Index:GPT-6 Luna max 为 41 分,比 GPT-5.6 Luna max 低 2 分;SWE-Atlas-QnA 从 49% 降至 44%,DeepSWE v1.1 从 66% 降至 64%。

  • AA-Omniscience:Luna max 幻觉率从 93% 降至 77%,准确率约从 43% 到 44%;文章说明 Luna 回答的问题变少。

  • AutomationBench-AA:Luna 从 50% 升至 53%。Terminal-Bench 4.0 从 12% 升至 13%。

  • GDPval-AA v2.1:文章报告 Luna 约下降 75 Elo;AA-Briefcase v1.1 约下降 45 Elo。作者检查数百份产物后,将退化归因于呈现质量变差、交付内容遗漏评分标准元素。

结论

Luna max 的优势主要是低成本;编码 Agent 与知识工作场景并非全面进步。对结果需要覆盖完整要求、产物格式和质量标准的任务,应检查交付内容并运行独立验收,而不能只依据综合分或每 token 价格选型。

局限

  • 指标与任务集由 Artificial Analysis 设计或运营,不能视为全行业统一标准。

  • 文章概述了版本、部分 harness 和结果,但未提供所有逐题输入及原始产物,复现程度有限。

  • 文章报告的分数受具体模型档位、harness、输出长度与价格假设影响。

  • Intelligence Index 的混合结果不能直接预测单个团队的任务表现;文章也明确指出不同基准方向有升有降。

复现步骤

  1. 记录文章列出的基准版本、GPT-6 Luna max、GPT-5.6 Luna max 与 Codex harness 版本。

  2. 对 SWE-Atlas-QnA、DeepSWE、AutomationBench、Terminal-Bench 和知识工作任务分别固定同一任务集、工具和评分规则。

  3. 保存每题输入/输出、任务状态、token 数、费用及人工评分,特别标记交付遗漏与呈现质量。

  4. 逐项报告成功率和成本,避免把文章综合指标直接外推到不同 harness。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GPT-6 Luna

在 Tabbit 中使用并对比模型

GPT-6 Luna

相关测评

官方OpenAI / Introducing GPT-6 Sol and Luna2026-09-22

OpenAI 官方发布:GPT-6 Luna 的基准结果与成本定位

媒体Artificial Analysis / GPT-6 Luna: Release Intelligence, Performance & Price2026-09

Artificial Analysis 发布面板:GPT-6 Luna 六档性能、成本与延迟

社区Reddit / r/codex2026-09-23

Reddit r/codex 用户反馈:GPT-6 Luna 编程体验与早期风险

社区Reddit / r/codex2026-09-23

Reddit r/codex 对 Artificial Analysis 排名的讨论:Luna 排名与主观体验

GPT-6 Luna

相关提示词

官方OpenAI Developers

GPT-6 模型家族提示词起步指南

官方OpenAI Developers

GPT-6 Luna API 模型配置

官方OpenAI Developers

OpenAI API 提示工程通用指南

官方OpenAI 官方发布说明2026-09-22

GPT-6 提示缓存与长流程 Agent 优化工作流