Artificial Analysis 的独立测评显示,Claude Sonnet 5.5 在 max effort 下以 56 分进入 Artificial Analysis Intelligence Index 第 2 名,并在终端 Agent 与知识工作任务上接近 Opus 5.5,但代价是该站测得最高的输出 token 用量和更高的单任务成本。
适合的任务:需要终端工具、代码执行、真实工作流和较长推理链的 Agent 任务;Terminal-Bench 4.0、AA-Briefcase、GDPval-AA 和 AutomationBench-AA 是较有参考价值的方向。
不适合的任务:对事实准确率、科学推理或成本上限极敏感,却没有额外预算和结果核验的生产流程。
适用的模型版本:Claude Sonnet 5.5 预发布部署(Artificial Analysis 文章快照);文章不是公开版本的最终回归结果。
适用的客户端、Agent 或 API:Artificial Analysis 的 Intelligence Index 评测环境;文章未公开可直接复制的 API 调用脚本或完整工具 schema。
推荐的推理档位和参数:文章比较了 low、medium、high、xhigh、max 五档,并启用 Anthropic 默认 fallback。若复测,应逐档固定 effort、fallback、工具集、超时和 token 上限。
评测主体:Artificial Analysis Intelligence Index,覆盖终端 Agent、知识工作、自动化、科学编码、事实知识和长上下文等任务。
模型输入与上下文:文章列出 1M token 上下文,并支持文本和图像输入;这些是模型规格,不是本次评测实际使用的上下文长度。
对比模型:Claude Opus 5.5、Claude Sonnet 5、GPT-6 Astra 和 GPT-6 Sol 等;不同任务使用各自的评测 harness,不能把所有数字视为同一套题目的单一总分。
推理档位:Sonnet 5.5 的 low、medium、high、xhigh、max 五档,启用 Anthropic 默认 fallback。
fallback:Artificial Analysis 观察到约 0.1% 的 Intelligence Index 任务发生 fallback,文章称这些情况均回落到 Sonnet 5,主要出现在 Terminal-Bench 4.0。
预发布边界:被测部署存在会降低 structured outputs 请求质量的 bug。Anthropic 在公开发布前修复了该问题,并预计最终结果变化很小或此前结果略被低估;Artificial Analysis 表示会重新运行相关评测。
价格背景:文章记录 Sonnet 5.5 与 Sonnet 5 同价:输入 $2、输出 $10、cache write $2.5、cache read $0.2(每百万 token)。
| 评测 | Claude Sonnet 5.5 | 对照或说明 |
|---|---|---|
| Artificial Analysis Intelligence Index(max) | 56 | 仅次于 Claude Opus 5.5(max)的 58;比 Sonnet 5(max)高 18 分 |
| Terminal-Bench 4.0(max) | 64% | Opus 5.5 为 60%,GPT-6 Astra(xhigh)为 60% |
| Terminal-Bench-Science(max) | 53% | 排在 GPT-6 Astra 与 Opus 5.5 之后;该评测当时未计入 Intelligence Index |
| AA-Briefcase | 1811 Elo | Opus 5.5 为 1822 Elo,接近持平 |
| GDPval-AA | 1844 Elo | Opus 5.5 为 1846 Elo,接近持平 |
| AutomationBench-AA | 71% | Opus 5.5 为 70%,为文章所列 headline score |
输出 token:max 下每个 Intelligence Index 任务约 193k output tokens,是 Artificial Analysis 当时测到的最高值;约比 Opus 5.5(max)或 Sonnet 5(max)高 60%,约为 GPT-6 Astra(max)的 7 倍。
单任务成本:文章称 Sonnet 5.5 约 $7.60/任务,比 Sonnet 5 的单任务成本高约 50%;在 Intelligence 与 Cost per Task 的权衡中,high effort 最有竞争力,但仍略落后于成本相近的 GPT-6 Sol。较低 effort 档位需分别比较质量与成本。
AA-Omniscience 事实准确率:Sonnet 5.5 为 54%,Opus 5.5 为 66%。
AA-Omniscience 幻觉率:Sonnet 5.5 为 47%,Opus 5.5 为 59%;此指标越低越好,不能直接当成事实答对率。
Humanity's Last Exam 与 SciCode:文章称 Sonnet 5.5 约比 Opus 5.5 低 6 分,但没有在正文中给出这两项的完整逐项分数表。
在 Artificial Analysis 的测量中,Sonnet 5.5 把 Sonnet 系列在终端使用和 Agent 工作流上的表现推到了接近 Opus 5.5 的区间:Terminal-Bench 4.0 为 64%,AA-Briefcase、GDPval-AA 和 AutomationBench-AA 也接近或略高于 Opus 5.5。它的主要交换条件是极高的输出 token 用量;因此选型时应把每任务成本、延迟和上下文预算与能力分开评估。知识准确率和科学推理仍低于 Opus 5.5,不能因总指数排名靠前而省略事实核验。
文章测的是预发布部署,structured outputs bug 已在公开发布前修复;相关结果需要等待 Artificial Analysis 的重新评测。
Artificial Analysis 未在文章中公开每个任务的完整 prompt、样本量、温度、工具 schema、逐轮轨迹和原始输出,因此可以复核结论与主要指标,不能仅凭文章完全复跑。
Intelligence Index、Terminal-Bench、GDPval-AA、AutomationBench-AA、AA-Omniscience 等使用不同任务集和评分方法,不能把分数直接横向当作统一成功率。
文章给出的约 $7.60 单任务成本来自其采集快照;模型价格、token 用量、provider 路由和缓存命中会改变实际成本。
fallback 比例、token 用量和榜单位置都依赖当时的模型部署与 Artificial Analysis harness,不能无条件外推到其他 API provider、客户端或自建 Agent。
固定公开版本的 Claude Sonnet 5.5 API snapshot、provider、effort 档位、默认 fallback 行为和 token 上限。
按同一套 Agent harness 分别复测 Terminal-Bench 4.0、Terminal-Bench-Science、AA-Briefcase 风格知识工作、GDPval-AA 风格办公任务和 AutomationBench-AA 风格 SaaS 流程。
为每个任务保存输入、工具调用、输出 token、reasoning token、延迟、失败类型、人工修正和成本;至少重复多次以估计方差。
另行测量 AA-Omniscience 风格事实准确率与幻觉率,并将事实错误与安全拒答分开统计。
将复测结果与本文的 56 分、64%、1811 Elo、1844 Elo、71% 等快照指标并列报告,不把自己的结果标成 Artificial Analysis 原始成绩。
文章的核心观察是 Sonnet 5.5 在 max 档接近 Opus 5.5,却使用了约 193k output tokens/任务;这组结论必须与对应的评测 harness 和预发布版本边界一起引用。
Claude Sonnet 5.5