Artificial Analysis 的同页六档对照显示,Astra Max 智能指数最高但单任务成本也最高,Low 的首 token 延迟和成本最低,适合按任务价值分层路由而非统一使用最高档。
适合的任务:在 Astra 的 Low、Medium、High、XHigh、Max 和该站标记的 Non-reasoning 变体之间做初步路由,比较综合智能、生成速度和每任务成本。
不适合的任务:用综合指数代替特定代码库、浏览器、法律或医疗任务的验收;页面数据也不等同于 SLA。
适用的模型版本:Artificial Analysis 页面在 2026-09-08 展示的 GPT-6 Astra 六个测试配置。
适用的客户端、Agent 或 API:页面称速度取第一方 API;具体请求参数、重复次数和模型快照需结合其方法页进一步核对。
推荐的推理档位和参数:低风险、低延迟或成本敏感任务先测 Low;需要更高综合分时测试 High/Max,并用任务级成功率判断额外成本是否值得。
Intelligence Index v4.3 组合 10 项评测:AA-Briefcase、GDPval-AA v2、AutomationBench-AA、Terminal-Bench v4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。
每任务成本是加权平均:各评测的输入、缓存命中、缓存写入、推理和答案 token 价格除以任务数,再按 Intelligence Index 权重汇总。
输出速度定义为收到首个 API chunk 后的生成 tokens/s;第一方模型使用第一方 API 表现。
页面没有在可见正文中提供每道输入、随机种子、重复次数、置信区间或失败日志。
| Astra 配置 | Intelligence Index v4.3 | 输出速度 | 每 Intelligence Index 任务成本 |
|---|---|---|---|
| Max | 53 | 61 tokens/s | $3.26 |
| XHigh | 53 | 57 tokens/s | $2.31 |
| High | 51 | 57 tokens/s | $1.72 |
| Medium | 50 | 55 tokens/s | $1.54 |
| Low | 46 | 53 tokens/s | $0.82 |
| Non-reasoning(页面标签) | 45 | 未显示 | $1.71 |
页面同时显示:Low 的 time to first answer token 最低,为 2.55 秒;六档每任务成本相差最多约 4 倍。进一步信息表中六档上下文均为 1M,列出的综合 token 价格字段均为 $7.7,不能把该字段与上表的“每评测任务成本”混为一谈。
作为同站同版本的相邻发布对照,页面列出 GPT-5.6 Sol 最高 Intelligence 为 47、Terra 为 42、Luna 为 38;这些是各发布系列的最高值,不是相同 effort 的逐档对照。
Max 相对 High 增加 2 分但每任务成本从 $1.72 升到 $3.26;XHigh 与 Max 在采集快照中同为 53 分,但 XHigh 的速度和成本更低。这个结果支持先用 High 或 XHigh 做候选,再对最难任务验证 Max,而不是默认最高档。
页面把一个配置标为 Non-reasoning,但 OpenAI 官方模型指南在同一采集日明确说 GPT-6 Astra 不支持 none reasoning effort。两者的标签或测试路径可能不同;在 Artificial Analysis 未公开该标签的精确 API 请求前,不应据此向 OpenAI API 发送 none。
这是动态榜单快照。采集过程中搜索缓存曾显示与当前页面不同的分数,最终以直接打开原始页面后可见的 2026-09-08 数据为准。后续复核必须记录采集日期和 Index 版本。
锁定 Intelligence Index v4.3、10 项组成评测、题集版本、权重和评分脚本。
固定 OpenAI 模型快照、请求端点、reasoning effort、上下文、缓存策略、最大输出和重试规则。
对每档运行同一题集并保存逐题输入、输出、评分、输入/缓存写入/缓存读取/推理/答案 token、首 token 延迟和生成速度。
按页面公开的加权公式重算每任务成本,并报告重复次数、均值、离散程度和失败率。
在目标业务任务上补充成功率和人工验收时间,因为综合指数相近不代表生产工作流成本相同。
GPT-6 Astra