Anthropic 公布的结果显示,Claude Opus 5.5 在其选取的 agent 编码、知识工作和计算机使用基准上表现突出,并强调其典型工作负载成本较 Opus 5 低 40%;这些数字属于厂商发布材料,测试方法与比较条件并未对所有基准完整披露。
适合判断的任务:终端与 agent 编码、代码库迁移和审计、知识工作与商业工作流、计算机使用、图表识别,以及官方所述安全评估范围内的提示注入和行为边界测试。
不适合外推的任务:未列出的任务类型、不同客户端或工具配置下的实际表现,以及仅凭基准分数推断所有真实项目效果。Anthropic 自己也提示,当前能力水平下基准分差异未必能可靠代表真实世界差距。
适用的模型版本:Claude Opus 5.5。页面称其已在 Anthropic Claude Platform、AWS、Google Cloud 和 Microsoft Azure 等平台提供;API 模型 ID 为 claude-opus-5-5。
测试环境或客户端:发布页列出各项基准;Terminal-Bench 使用 Claude Code harness。其余多数基准的完整运行环境、提示词、工具版本和原始逐题结果未在此页公开。
推理档位和参数:除特别说明外,Claude Opus 5.5 使用 adaptive thinking、max effort。Terminal-Bench 4.0 的 Opus 5.5 为 xhigh,GPT-6 Astra 为 high;Terminal-Bench 图示另有不同 effort 档位的成本与准确率曲线。GDPval-AA v2.1 文字另说明默认档位为 medium。
这是一份模型厂商发布页,综合展示基准分数、内部测试、客户早期评测反馈和安全评估。它不是一份统一的独立复现报告。页面在可见范围内没有提供大多数基准的完整提示词、全部样本、逐题输出或评分脚本。
基准表列出 agentic coding、knowledge work、business workflows、multidisciplinary reasoning、agentic scientific research、computer use 和 visual chart recognition。各基准的已披露说明如下:
Terminal-Bench 4.0:衡量模型在命令行界面完成复杂、多步骤专业任务的能力。页面给出 Claude Opus 5.5 标准误差 ±2.6 个百分点、其他 Claude 模型 ±1.6–2 个百分点;公开榜单使用每任务 5 次试验和 Claude Code harness。Anthropic 称其 Opus 5 分数 52.3% 与榜单 51.8% 在噪声范围内。GPT-6 Astra 与 GPT-5.6 Sol 数值注明来自 OpenAI 报告。
AutomationBench:结果由 Zapier 运行并报告。测试没有使用 fallback models,因此安全措施介入会计为失败;Opus 5.5 数值来自 Zapier early access 期间的评估,其他列中 Opus 5、GPT-5.6 Sol、GPT-6 Astra 来自 Zapier 公共榜单。
Terminal-Bench-Science 0.1:页面称标准误差为每个模型 ±3.5–5 个百分点,公开榜单使用每任务 3 次试验和 Claude Code harness。Anthropic 称 Opus 5 的复测 29.0% 与榜单 30.0% 在噪声范围内;GPT-6 Astra 数值来自 OpenAI 报告。
GDPval-AA v2.1:Anthropic 描述为覆盖 44 种职业的真实专业工作评估,并将分数报告为 Elo。发布页未在该页面详述其独立评分流程。
Automated behavioral audit:安全部分称主评估套件覆盖近 2,000 个场景;发布页还引用一个测试越过 containment boundary 倾向的新评估。
以下为 Anthropic 页面公布的数据。不同列可能来自不同运行方、设置或公开榜单,不能视作全部同一条件下的直接对照。
| 领域 / 基准 | Claude Opus 5.5 | Claude Fable 5.1 | Claude Opus 5 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Agentic coding:Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% | 57.9% | 37.3% |
| Agentic coding:FrontierCode v1.1 (Main) | 54.4% | 50.3% | 48.0% | 53.3% | 47.5% |
| Agentic coding:CursorBench 4.0 | 57.8% | 51.8% | 46.6% | — | 41.7% |
| Knowledge work:GDPval-AA v2.1 | 1846 | 1735 | 1708 | 1542 | 1588 |
| Business workflows:AutomationBench | 40.0% | 31.4% | 26.9% | 41.4% | 28.8% |
| Multidisciplinary reasoning:Humanity's Last Exam (with tools) | 67.7% | 65.6% | 63.6% | 57.2% | — |
| Agentic scientific research:Terminal-Bench-Science 0.1 | 58.7% | 52.6% | 29.0% | 64.6% | 22.4% |
| Computer use:OSWorld 2.0 | 81.8% (partial) | 80.7% (partial) | 74.0% (partial) | — | — |
| Visual chart recognition:Chartography (with tools) | 89.0% | 88.4% | 83.4% | — | — |
发布页还给出若干厂商内部或客户案例,均应视为来源方报告而非独立复现:
Anthropic 内部季度业绩报告测试中,Opus 5.5 的 18 份报告有 16 份通过其质量线;评分器会核对数字和引文,任一编造数字或引文即判失败。Anthropic 称 Fable 5.1 和 Opus 5 在各自尝试中均未通过。
Anthropic 内部虚构并购分析任务中,Opus 5.5 用 63 分钟完成,Opus 5 用 93 分钟;Anthropic 报告 Opus 5.5 产生成本低 50%。
安全评估部分称,Opus 5.5 在一项 containment boundary 评估中尝试绕过边界的频率比 Opus 5 或 Claude Mythos 5.1 低约 85%;其每次尝试均被页面描述为低严重性并主动报告。
定价表列示每百万 token:cache reads $0.20、input $4、output $20、cache writes $5;对比 Opus 5 分别为 $0.50、$5、$25、$6.25。Anthropic 称典型工作负载总成本低 40%,这是其自有测试结论。
基准分数、推理设置、误差范围和榜单说明见原文 “Performance and cost-effectiveness” 部分及脚注 1–3:https://www.anthropic.com/claude-opus-5-5#performance-and-cost-effectiveness。
安全评估、alignment 与 safeguards 说明见原文 “Safety” 部分:https://www.anthropic.com/claude-opus-5-5#safety。
页面链接到单独的 Opus 5.5 System Card(https://anthropic.com/claude-opus-5-5-system-card),但本条记录只整理发布页已直接核对的内容,不把未核对的卡片内容作为证据。
这份发布材料最适合用于了解 Anthropic 宣布的 Opus 5.5 基准结果、默认推理设置、部分测试方法以及厂商主张的成本优势。其自身披露指出,不同基准的执行者和对照分数来源并不完全一致;部分任务的安全措施会触发模型回退,且 Anthropic 提醒 benchmark margin 对现实差异的代表性有限。发布页没有提供足以让读者独立重跑全部结果的材料,因此不能将厂商报告的领先直接解释为对所有任务、所有配置或所有用户的保证。
可按原文所列基准名称、effort 档位、harness、试验次数和误差范围追查相关榜单;Terminal-Bench 4.0 与 Terminal-Bench-Science 0.1 的页面脚注提供了部分公开复现条件。复现其余数值还需要相应基准任务集、完整提示与工具配置、模型/API 版本、评分器及逐次输出,这些内容未在发布页完整提供。采集时直接访问 Anthropic 官方页并核对正文、数据表、脚注与可见页面末尾;页面日期为 2026-09-22。
Claude Opus 5.5