Anthropic 的发布页显示,Claude Sonnet 5.5 在其选取的 Agent 编码、知识工作、电脑使用和图表识别基准上大幅超过 Sonnet 5,并以与 Sonnet 5 相同的标价和更少的任务 token 实现最高 30% 的单任务成本下降;这些结果是厂商发布材料,部分评测运行条件、完整样本和原始输出未公开。
适合判断的任务:命令行中的多步骤专业任务、代码修复与代码库理解、边界清晰的职业及知识工作、电脑操作、图表识别,以及在 Anthropic 页面所述范围内的安全与对齐评估。
不适合外推的任务:未列出的任务类型、其他客户端或工具配置下的实际效果、真实生产代码库的缺陷率,以及仅凭基准分数推断所有复杂开放式工作的表现。Anthropic 明确提醒,Opus 5.5 在需要持续判断的复杂开放式工作上仍更强。
适用的模型版本:Claude Sonnet 5.5;页面给出的开发者 API 模型名为 claude-sonnet-5-5。页面称该模型已在 Claude Platform、Amazon Web Services、Google Cloud 和 Microsoft Azure 提供。
测试环境或客户端:页面列出 Terminal-Bench 4.0、FrontierCode 1.1 (Main)、CursorBench 4.0、GDPval-AA v2.1、AA-Briefcase v1.1、Humanity's Last Exam、OSWorld 2.1 和 Chartography。除页面特别注明的基准描述、工具设置和脚注外,完整运行环境没有在此页公开。
推理档位和参数:发布页的综合表同时报告不同 effort 档位的成本曲线;Claude 应用和 Claude Code 默认使用 Medium,Claude Platform 默认使用 High。页面没有在这份发布页中给出温度、随机种子或完整 API 参数。
这是一份模型厂商发布页,汇总公开基准、成本与速度比较、自动化行为审计、Anthropic 内部测试和早期测试者反馈。它不是一份统一设置下的独立复现报告。发布页没有提供大多数评测的完整提示词、全部样本、逐题输出、评分脚本或运行日志。
页面对评测的可见说明如下:
Terminal-Bench 4.0:衡量模型在命令行界面完成复杂、多步骤专业任务的能力。页面将 Sonnet 5.5 在 Claude 应用中的 Medium effort 描述为默认设置,并称该模型在此设置下超过 Sonnet 5 的最好成绩,同时单任务成本不到其十分之一。页面脚注说明表中的 Opus 5.5 数值使用 Xhigh effort;页面还说明 Terminal-Bench 和 OpenAI 没有公开 GPT-6 Sol 结果,因此表中报告 GPT-5.6 Sol。
FrontierCode 1.1 (Main):评估代码变更能否在没有人工编辑的情况下合并,并会惩罚超出任务范围的改动。页面脚注说明 Sonnet 5.5 在 Max effort 的成绩低于 Xhigh,因为它更常运行 Claude Code 的 code-review skill;Cognition 检查的两个案例中,该行为导致超时或产生超出范围的额外编辑。
GDPval-AA v2.1 与 AA-Briefcase v1.1:页面称 GDPval-AA 覆盖 44 种职业和 9 个主要行业;页面脚注说明 Artificial Analysis 在 Claude Platform 的预发布部署上运行这两项评测,该部署存在可能损害结构化输出请求的 bug,Anthropic 认为影响若存在也较小且会低估 Sonnet 5.5,bug 后来已修复。
Humanity's Last Exam:页面表中标注为 with tools,但未在发布页提供完整工具配置、题目数量或评分细节。
OSWorld 2.1:页面表中标注为 partial;发布页没有给出完整任务清单、交互轨迹或成功判定脚本。
Chartography:页面表中标注为 no tools;发布页没有给出完整图表样本、评分脚本或逐题结果。
自动化行为审计:Anthropic 称审计覆盖约 1,850 个场景,用于评估对齐、抵抗滥用和诚实性。页面称 Sonnet 5.5 在大多数指标上超过或匹配 Sonnet 5;在 containment 评估中,它接近 Opus 5.5,并且是 Anthropic 所测模型中最少探测容器边界的模型。页面同时声明任何评估都不能可靠捕获所有失败模式。
以下为 Anthropic 发布页表格中的结果。带有 effort、工具或 partial/no tools 标注的结果只适用于该标注条件。
| 领域 / 基准 | Claude Sonnet 5.5 | Claude Sonnet 5 | Claude Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Agentic coding:Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4%¹ | — |
| Agentic coding:FrontierCode 1.1 (Main) | 46.2% Max²;52.1% Xhigh | 42.4% | 54.4% | 49.3% Max;52.1% Xhigh |
| Agentic coding:CursorBench 4.0 | 55.5% | 34.1% | 57.8% | — |
| Knowledge work:GDPval-AA v2.1 | 1844 | 1449 | 1846 | 1487⁴ |
| Knowledge work:AA-Briefcase v1.1 | 1811 | 1359 | 1822 | 1483⁴ |
| Multidisciplinary reasoning:Humanity's Last Exam | 64.5%(with tools) | 54.9%(with tools) | 67.7%(with tools) | — |
| Computer use:OSWorld 2.1 | 80.1%(partial) | 57.0%(partial) | 81.8%(partial) | — |
| Visual chart recognition:Chartography | 61.6%(no tools) | 15.6%(no tools) | 64.4%(no tools) | 53.6%⁴(no tools) |
页面还披露了以下成本、速度与测试结论:
编码与电脑使用:Sonnet 5.5 的 Terminal-Bench 4.0 分数为 70.6%,Sonnet 5 为 10.3%;CursorBench 4.0 为 55.5%,Sonnet 5 为 34.1%;OSWorld 2.1 的 partial 分数为 80.1%,Sonnet 5 为 57.0%。Anthropic 称 Sonnet 5.5 是首个仅凭截图操作就击败 Pokémon Red 的 Sonnet 模型,但发布页没有给出该测试的完整输入和评分数据。
知识工作:GDPval-AA v2.1 为 1844,Sonnet 5 为 1449;AA-Briefcase v1.1 为 1811,Sonnet 5 为 1359。页面将 GDPval-AA 描述为覆盖 44 种职业和 9 个主要行业,并称 Sonnet 5.5 接近 Opus 5.5。
成本:发布页列出每百万 token 的 cache reads 为 $0.20,cache writes 为 $2.50,输入为 $2,输出为 $10。页面明确称 Sonnet 5.5 与 Sonnet 5 的输入、输出和 cache reads 同价;未明确比较两者的 cache writes。Anthropic 测试中每项任务成本最高可低 30%,但页面没有公开完整任务集、调用日志或统计区间。
速度:Anthropic 称 Sonnet 5.5 生成输出的速度比 Sonnet 5 快 30% 以上,是其当时速度最快的 Sonnet 模型;页面未提供统一硬件、请求长度、并发度和延迟分布。
effort 与成本:页面说明 effort 越高通常工作时间越长、单任务成本越高,同时分数通常也会提高;较低档位更适合例行任务,较高档位会进行更长推理和更多检查。发布页没有给出全部图表的逐点数值。
安全与防护:Sonnet 5.5 使用与 Opus 5.5 类似的网络安全防护,并在高风险网络安全任务上回退到 Sonnet 5;生物安全防护与 Sonnet 5 相同。页面称 Sonnet 5.5 首次在 Sonnet 系列中配备防止 reasoning extraction 的安全分类器,并扩展 preserved thinking。以上是 Anthropic 的发布与安全主张,不是外部独立测评。
| 指标 | Sonnet 5.5 | Sonnet 5 | 备注 |
|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 10.3% | 页面描述为 agentic coding;表中未给 Sonnet 5.5 的 effort 标注 |
| FrontierCode 1.1 (Main) | 46.2% Max;52.1% Xhigh | 42.4% | Max 低于 Xhigh 的原因见脚注 2 |
| CursorBench 4.0 | 55.5% | 34.1% | 页面描述为 agentic coding |
| GDPval-AA v2.1 | 1844 | 1449 | Artificial Analysis 预发布部署;结构化输出 bug 可能使 Sonnet 5.5 分数偏低 |
| AA-Briefcase v1.1 | 1811 | 1359 | Artificial Analysis 预发布部署;结构化输出 bug 可能使 Sonnet 5.5 分数偏低 |
| Humanity's Last Exam | 64.5% with tools | 54.9% with tools | 页面未提供完整工具配置 |
| OSWorld 2.1 | 80.1% partial | 57.0% partial | 页面未提供完整任务清单 |
| Chartography | 61.6% no tools | 15.6% no tools | 页面未提供完整图表样本和评分脚本 |
| 项目(每百万 token) | Claude Sonnet 5.5 | Claude Opus 5.5 |
|---|---|---|
| Cache reads | $0.20 | $0.20 |
| Cache writes | $2.50 | $5 |
| Input tokens | $2 | $4 |
| Output tokens | $10 | $20 |
这份官方材料支持一个有限结论:在 Anthropic 选用并披露的评测中,Sonnet 5.5 相比 Sonnet 5 在编码、知识工作、电脑使用和图表识别上取得更高分;发布页列出的输入、输出和 cache reads 价格与 Sonnet 5 相同。Anthropic 的内部测试还报告了更少的任务 token、最高 30% 的单任务成本下降和 30% 以上的生成速度提升。FrontierCode 的成绩受 effort 和 Claude Code code-review skill 影响,不能把 Max 与 Xhigh 的数值当作同一设置下的简单比较。
这些结果来自 Anthropic 发布页,且不同基准的工具、effort、数据来源和测试条件并不完全一致。GDPval-AA 与 AA-Briefcase 使用预发布部署,页面脚注披露该部署存在结构化输出 bug;至少 Terminal-Bench 的 Opus 5.5 结果使用 Xhigh,其他项目的 effort 条件未在页面完整标出。Anthropic 同时明确指出,基准分数只覆盖能力的一部分,Opus 5.5 在复杂、开放式且需要持续判断的工作上仍然更强。因此,这些数据不能保证 Sonnet 5.5 在任意代码库、客户端、参数或生产工作流中达到同样表现。
安全段落中的约 1,850 场景、回退机制、容器边界和 reasoning extraction 说明是 Anthropic 的自有评估与产品防护披露,不应当解释为涵盖所有安全失败模式的证明。页面称网络安全和生物安全防护面向较窄的高风险请求,常规软件开发和大多数生命科学工作不受影响。
发布页公开了基准名称、部分工具与 effort 标注、汇总分数、定价和若干脚注,但没有提供全部任务输入、样本量、完整提示词、模型快照、随机参数、工具配置、评分脚本、逐题输出或运行日志。读者可以按页面表格和脚注核对公开数字,不能仅依据此页独立重跑完整结果。
若要复现同类比较,至少需要锁定各基准的版本和任务清单、Sonnet 5.5 与 Sonnet 5 的确切模型构建、effort 和其他 API 参数、工具或 harness、重复运行次数、评分规则,以及 GDPval-AA 与 AA-Briefcase 的预发布部署状态。FrontierCode 还需要记录是否触发 Claude Code 的 code-review skill 和是否发生超时或范围外编辑。以上页面中未全部公开。
¹ Anthropic 页面脚注:Terminal-Bench 4.0 的 Opus 5.5 结果使用 Xhigh effort,代表该模型的最高分。
² Anthropic 页面脚注:FrontierCode 会惩罚超出范围的高质量或有帮助的改动;Sonnet 5.5 在 Max effort 更常运行 Claude Code 的 code-review skill,Cognition 检查的两个案例分别出现超时或额外编辑,导致分数更低。
³ Anthropic 页面脚注:Artificial Analysis 在 Claude Platform 的 Sonnet 5.5 预发布部署上运行 GDPval-AA 和 AA-Briefcase;该部署存在可能损害结构化输出请求的 bug,之后已修复。
⁴ Anthropic 页面脚注:OpenAI 修复过一个降低 GPT-6 Sol 图像理解能力的 bug;Artificial Analysis 和 Surge AI 的相关官方分数可能尚未反映该版本变化。
Claude Sonnet 5.5