Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评
官方GPT-6 Luna

OpenAI 官方发布:GPT-6 Luna 的基准结果与成本定位

原始来源

OpenAI / Introducing GPT-6 Sol and Luna

作者OpenAI

原文日期2026-09-22

Tabbit 整理2026-09-22

查看原文

一句话结论

OpenAI 将 GPT-6 Luna 定位为低成本、高吞吐模型,并报告其在 AutomationBench、DeepSWE 与 OSWorld 上相对前代的提升,但公开页未提供完整逐题数据和所有复现配置。

测试环境

  • 模型/入口:GPT-6 Luna;发布页同时报告不同 reasoning effort 档位。DeepSWE 报告使用 max effort。

  • 基准:AutomationBench 1.0.6、DeepSWE v1.1、OSWorld 2.0 offline,以及内部事实性评估。

  • 价格:每百万输入 token $0.10、输出 token $0.50;这是发布页列出的 API 价格。

  • 对照:主要与 GPT-5.6 Luna 比较,部分任务还与 GPT-6 Sol、GPT-6 Astra 及 Claude 系列比较。

输入/配置

发布页描述 AutomationBench 为跨应用业务工作流,覆盖 47 种工具及销售、营销、运营、支持、财务和 HR;DeepSWE 是真实代码库中的长程软件工程任务;OSWorld 2.0 为日常及专业电脑操作工作流。

结果数据

  • AutomationBench:GPT-6 Luna 在 high effort 下比 GPT-5.6 Luna 高 5.4 个百分点,官方称每任务成本低 58%。页面没有在正文表格中给出两者的精确绝对分数。

  • DeepSWE v1.1:GPT-6 Luna max 得分 66.6%,官方称与 Claude Opus 5、Fable 5 的 medium 档相近;每任务成本分别低 93% 和 96%。

  • OSWorld 2.0 offline:GPT-6 Luna max 超过 GPT-5.6 Sol medium,官方称成本约为其十分之一。

  • 事实性:OpenAI 称 Luna 有明显改善;较高 effort 时可达到 GPT-5.6 Sol 的水平,约为其百分之一成本。该结果使用内部、经过去标识化且曾被用户标记为事实错误的 ChatGPT 对话。

  • 官方说明其事实性数据不是典型使用分布,且未按答案长度控制。

结论

官方数据支持把 Luna 纳入成本敏感的编码 Agent、跨应用工作流和电脑使用候选。具体任务仍需按自己的工具、提示、effort 档位和验收规则测试,不能把发布页的相对成本结论直接等同于固定生产账单。

局限

  • 这是模型厂商自报结果,不能替代独立复测。

  • 发布页未公开所有 benchmark 的完整提示词、逐题结果、重复次数、置信区间和 harness 配置。

  • 不同基准使用的 effort、工具和模型对照不同;跨基准分数不可直接比较。

  • AutomationBench 的 Claude Fable 5.1 成本未计入约 40% 任务上的 Opus 5 fallback,OpenAI 明确指出该成本被低估。

  • OSWorld、内部事实性结果来自特定数据集版本和筛选方式,不能外推为所有桌面任务或日常问答表现。

复现步骤

  1. 固定模型快照、API provider、reasoning effort、工具权限和各基准版本。

  2. 对照 GPT-5.6 Luna,在相同任务集和 harness 下分别重复运行 AutomationBench、DeepSWE 与 OSWorld。

  3. 保存原始输入、工具轨迹、逐题评分、完成状态、token、延迟和实际费用。

  4. 单独报告任务成功率、成本和人工交付质量;不要将不同基准的百分比合并成单一排名。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GPT-6 Luna

在 Tabbit 中使用并对比模型

GPT-6 Luna

相关测评

媒体Artificial Analysis / GPT-6 Sol and Luna push the cost efficiency frontier2026-09-22

Artificial Analysis 独立评测:GPT-6 Luna 的成本、智能与编码结果

媒体Artificial Analysis / GPT-6 Luna: Release Intelligence, Performance & Price2026-09

Artificial Analysis 发布面板:GPT-6 Luna 六档性能、成本与延迟

社区Reddit / r/codex2026-09-23

Reddit r/codex 用户反馈:GPT-6 Luna 编程体验与早期风险

社区Reddit / r/codex2026-09-23

Reddit r/codex 对 Artificial Analysis 排名的讨论:Luna 排名与主观体验

GPT-6 Luna

相关提示词

官方OpenAI Developers

GPT-6 模型家族提示词起步指南

官方OpenAI Developers

GPT-6 Luna API 模型配置

官方OpenAI Developers

OpenAI API 提示工程通用指南

官方OpenAI 官方发布说明2026-09-22

GPT-6 提示缓存与长流程 Agent 优化工作流