Artificial Analysis 汇总的六个 effort 档位显示 Luna 的性能、速度和每任务成本差异明显,max 档得分最高,low 档成本最低。
模型/入口:GPT-6 Luna low、medium、high、xhigh、max 和 non-reasoning;页面列出的 provider 为 OpenAI。
综合基准:Artificial Analysis Intelligence Index v4.3.2,页面说明由 AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 与 AA-LCR v1.1 共 10 项评测构成。
价格口径:Cost per Intelligence Index Task;模型榜单中的价格和任务费用需与基准版本、token 使用量一起理解。
上下文:页面列出 1M tokens。
页面提供综合分、输出速度、首 token 延迟、每任务费用和评测组成,未提供可下载的逐题输入、全部运行配置或原始输出。
| Effort | Intelligence Index | 输出速度 | 每 Index 任务成本 |
|---|---|---|---|
| max | 37 | 154 tokens/s | $0.07 |
| xhigh | 34 | 153 tokens/s | $0.04 |
| high | 32 | 144 tokens/s | $0.03 |
| medium | 29 | 143 tokens/s | $0.02 |
| low | 21 | 176 tokens/s | $0.0045 |
| non-reasoning | 18 | 136 tokens/s | $0.01 |
页面称 non-reasoning 首 token 延迟最低,为 0.72 秒。
六档任务成本最高与最低约相差 15 倍;low 输出速度最快,但综合指数低于更高 effort 档位。
effort 选择会显著改变 Luna 的费用和综合表现。批量、简单任务可评估 low 或 non-reasoning;要求更高质量的任务应与 high/max 档实测,并以本地验收指标决定档位。
这是交互式汇总面板,不是完整的 benchmark 方法报告。
Index 是多项不同评测的加权汇总;单一分值会隐藏各任务表现差异。
页面没有提供每个档位的逐题数据、方差、置信区间和所有调用参数。
速度、延迟和成本会随 provider、提示长度、输出长度与服务负载变化。
在相同 API provider、固定输入和输出长度要求下测试六档 effort。
记录每个任务的完成状态、人工质量评分、输入/输出 token、首 token 延迟、总延迟与账单费用。
对照页面所列的十项评测版本,分别看任务结果,不以 Index 汇总分替代任务验收。
同一任务重复多次,并报告中位数与波动范围。
GPT-6 Luna