Artificial Analysis 的 2026-09-22 截面中,Claude Opus 5.5 的 max 档以 Intelligence Index 58 分列榜首,强项集中在知识工作和多项 Agent 评测,但输出量较大,单项指数任务成本约为 5.98 美元。
适合判断的任务:综合推理与知识、Agent 知识工作、终端编程、代码科学任务、自动化工作流;也可比较不同 effort 档位下的指数分数、输出量与估算任务成本。
不适合外推的任务:未纳入这十项指数评测的任务、特定企业私有工作流、其他推理参数或 Agent 配置;AA-Briefcase 含私有评测集,不能仅凭公开摘要独立复跑其结果。
适用的模型版本:Claude Opus 5.5;Artificial Analysis 模型页显示的测试变体为 Adaptive Reasoning,并启用 Anthropic 默认 fallback。
测试环境或客户端:Artificial Analysis 自有评测;AA-Briefcase 使用其开源参考 Agent harness Stirrup。文章未给出其余评测的完整执行配置、逐项输入或提交记录。
推理档位和参数:low、medium、high、xhigh、max 五档;文章称 Intelligence Index 五档均启用了 Anthropic 默认 fallback。文章未注明其他推理参数。
Artificial Analysis Intelligence Index v4.3.2 汇总十项评测:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。指数版本及评测清单来自同一机构的模型页;榜单和成本均为采集日可见的动态快照。
文章覆盖五种 effort 档位的指数测评。它特别说明 AA-Briefcase v1.1 是 Artificial Analysis 的私有前沿知识工作评测,通过开源参考 Agent harness Stirrup 评估模型能否生成准确、呈现良好的专业产物。Artificial Analysis 的方法说明将单项任务成本定义为按指数权重汇总输入、缓存和输出 token 的加权平均;因此成本同时受价格和 token 消耗影响。
文章没有公开十项评测的完整提示词、各项样本数、模型调用日志或各 effort 档的完整逐项成绩。除 AA-Briefcase 外,本文不推断各评测使用的具体 Agent harness。
综合指数:Claude Opus 5.5 max 得分 58,为文章所述当时最高分;模型页采集时也显示 #1 / 212。这个排名对应 v4.3.2 的当日快照,不代表永久排名。
领先的六项:Humanity's Last Exam 61.4%(此前最高为 Claude Fable 5.1 的 59.1%)、SciCode 66.9%(此前最高为 Fable 5.1 的 63.1%)、GDPval-AA v2.1、AA-Briefcase v1.1、AA-Omniscience、AutomationBench-AA。文章未列出其余三项的完整数值。
终端与代码:Terminal-Bench 4.0 为 59.6%,与 GPT-6 Astra xhigh 并列领先,比 Opus 5 高 11 个百分点。模型仍落后于其他模型的项目包括 CritPt、AA-LCR 和 GDP.pdf。
Agent 知识工作:AA-Briefcase v1.1 为 1,822 Elo,比 Fable 5.1 高 143;分析质量与呈现子分均领先,但 rubric 评分略低于 Fable 5.1。GDPval-AA v2.1 为 1,846 Elo,比 Fable 5.1 高 111、比 Opus 5 高 138。
档位与成本前沿:五档中 max、xhigh、high、medium 四档位于 Intelligence 对单项任务成本的 Pareto 前沿;文章将比较范围描述为指数分数 50 以上的模型。
输出量与单项成本:max 档每项指数任务约生成 119k output tokens,Opus 5 max 约 73k、Fable 5.1 max 约 78k、GPT-6 Astra max 约 27k。模型页采集快照显示加权平均每项指数任务成本为 $5.98。
评测总费用与累计输出量:模型页显示完整 Intelligence Index 测评总成本为 $8,708.20,累计生成 260M output tokens。累计量与文章的每任务约 119k 属于不同统计口径,不能互相替代。
价格与上下文:Artificial Analysis 页面列出的 API 价格为每百万输入 token $4、输出 token $20、cache read $0.20;1M token 上下文,支持文本和图像输入、文本输出。页面称相比 Opus 5 的 $5/$25 输入/输出价格下降 20%,cache read 从 $0.50 降至 $0.20。价格是页面所列 API 定价信息,不是独立基准测出的模型能力。
| 指标 | Claude Opus 5.5 结果 | 对比或口径 |
|---|---|---|
| Artificial Analysis Intelligence Index | 58(max) | v4.3.2,模型页采集快照排名 #1 / 212 |
| Humanity's Last Exam | 61.4% | Fable 5.1 此前最高 59.1% |
| SciCode | 66.9% | Fable 5.1 此前最高 63.1% |
| Terminal-Bench 4.0 | 59.6% | 与 GPT-6 Astra xhigh 并列;比 Opus 5 高 11 个百分点 |
| AA-Briefcase v1.1 | 1,822 Elo | 比 Fable 5.1 高 143 |
| GDPval-AA v2.1 | 1,846 Elo | 比 Fable 5.1 高 111;比 Opus 5 高 138 |
| Intelligence Index 单项任务输出 | 约 119k tokens | Opus 5 max 约 73k;Fable 5.1 max 约 78k;GPT-6 Astra max 约 27k |
| 加权平均单项任务成本 | $5.98 | 模型页所示采集快照 |
| 完整指数评测总成本 | $8,708.20 | 模型页所示采集快照 |
| 指数评测累计输出 | 260M tokens | 模型页所示累计口径 |
| API 价格 | 输入 $4 / 输出 $20 / cache read $0.20,每百万 token | Artificial Analysis 页面列价;非能力测评结果 |
这份测评支持将 Opus 5.5 max 视为当时 Artificial Analysis 指数中的综合领先模型之一,尤其适合重视 Agent 知识工作质量的场景。Terminal-Bench 4.0 的结果显示其与 GPT-6 Astra xhigh 接近,但每项指数任务输出约为 Astra max 的四倍以上;实际成本还取决于请求长度、缓存命中、价格和工作流。
结论应限定在 Artificial Analysis 的 v4.3.2 指数与 2026-09-23 可见快照。十项评测的覆盖面不能代表所有工作;AA-Briefcase 是私有测试集,且文章未披露完整输入、逐项数据和运行日志,外部读者无法完整复现排名。文章报告的价格变化属于页面披露的定价信息,应与独立测出的基准表现分开理解。
可先在 Artificial Analysis 模型页核对 Intelligence Index 版本、评测组成、模型变体与当日动态数据;再依照其方法说明理解加权任务成本口径。要严格复现分数,需要取得各项 benchmark 的版本、完整提示词、样本与权重、fallback 行为、工具配置及运行日志;文章没有全部提供。AA-Briefcase 使用 Stirrup,但评测集私有,因此其 Elo 不能据本文完整复跑。
Claude Opus 5.5