Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评
媒体GPT-6 Luna

Artificial Analysis 发布面板:GPT-6 Luna 六档性能、成本与延迟

原始来源

Artificial Analysis / GPT-6 Luna: Release Intelligence, Performance & Price

作者Artificial Analysis

原文日期2026-09

Tabbit 整理1970-01-01

查看原文

一句话结论

Artificial Analysis 汇总的六个 effort 档位显示 Luna 的性能、速度和每任务成本差异明显,max 档得分最高,low 档成本最低。

测试环境

  • 模型/入口:GPT-6 Luna low、medium、high、xhigh、max 和 non-reasoning;页面列出的 provider 为 OpenAI。

  • 综合基准:Artificial Analysis Intelligence Index v4.3.2,页面说明由 AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 与 AA-LCR v1.1 共 10 项评测构成。

  • 价格口径:Cost per Intelligence Index Task;模型榜单中的价格和任务费用需与基准版本、token 使用量一起理解。

  • 上下文:页面列出 1M tokens。

输入/配置

页面提供综合分、输出速度、首 token 延迟、每任务费用和评测组成,未提供可下载的逐题输入、全部运行配置或原始输出。

结果数据

EffortIntelligence Index输出速度每 Index 任务成本
max37154 tokens/s$0.07
xhigh34153 tokens/s$0.04
high32144 tokens/s$0.03
medium29143 tokens/s$0.02
low21176 tokens/s$0.0045
non-reasoning18136 tokens/s$0.01
  • 页面称 non-reasoning 首 token 延迟最低,为 0.72 秒。

  • 六档任务成本最高与最低约相差 15 倍;low 输出速度最快,但综合指数低于更高 effort 档位。

结论

effort 选择会显著改变 Luna 的费用和综合表现。批量、简单任务可评估 low 或 non-reasoning;要求更高质量的任务应与 high/max 档实测,并以本地验收指标决定档位。

局限

  • 这是交互式汇总面板,不是完整的 benchmark 方法报告。

  • Index 是多项不同评测的加权汇总;单一分值会隐藏各任务表现差异。

  • 页面没有提供每个档位的逐题数据、方差、置信区间和所有调用参数。

  • 速度、延迟和成本会随 provider、提示长度、输出长度与服务负载变化。

复现步骤

  1. 在相同 API provider、固定输入和输出长度要求下测试六档 effort。

  2. 记录每个任务的完成状态、人工质量评分、输入/输出 token、首 token 延迟、总延迟与账单费用。

  3. 对照页面所列的十项评测版本,分别看任务结果,不以 Index 汇总分替代任务验收。

  4. 同一任务重复多次,并报告中位数与波动范围。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GPT-6 Luna

在 Tabbit 中使用并对比模型

GPT-6 Luna

相关测评

官方OpenAI / Introducing GPT-6 Sol and Luna2026-09-22

OpenAI 官方发布:GPT-6 Luna 的基准结果与成本定位

媒体Artificial Analysis / GPT-6 Sol and Luna push the cost efficiency frontier2026-09-22

Artificial Analysis 独立评测:GPT-6 Luna 的成本、智能与编码结果

社区Reddit / r/codex2026-09-23

Reddit r/codex 用户反馈:GPT-6 Luna 编程体验与早期风险

社区Reddit / r/codex2026-09-23

Reddit r/codex 对 Artificial Analysis 排名的讨论:Luna 排名与主观体验

GPT-6 Luna

相关提示词

官方OpenAI Developers

GPT-6 模型家族提示词起步指南

官方OpenAI Developers

GPT-6 Luna API 模型配置

官方OpenAI Developers

OpenAI API 提示工程通用指南

官方OpenAI 官方发布说明2026-09-22

GPT-6 提示缓存与长流程 Agent 优化工作流