Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评
媒体Claude Opus 5.5

Claude Opus 5.5 官方能力基准与适用边界

原始来源

Anthropic 官方网站

作者Anthropic

原文日期2026-09-22

Tabbit 整理2026-09-22

查看原文

一句话结论

Anthropic 公布的结果显示,Claude Opus 5.5 在其选取的 agent 编码、知识工作和计算机使用基准上表现突出,并强调其典型工作负载成本较 Opus 5 低 40%;这些数字属于厂商发布材料,测试方法与比较条件并未对所有基准完整披露。

适用场景

  • 适合判断的任务:终端与 agent 编码、代码库迁移和审计、知识工作与商业工作流、计算机使用、图表识别,以及官方所述安全评估范围内的提示注入和行为边界测试。

  • 不适合外推的任务:未列出的任务类型、不同客户端或工具配置下的实际表现,以及仅凭基准分数推断所有真实项目效果。Anthropic 自己也提示,当前能力水平下基准分差异未必能可靠代表真实世界差距。

  • 适用的模型版本:Claude Opus 5.5。页面称其已在 Anthropic Claude Platform、AWS、Google Cloud 和 Microsoft Azure 等平台提供;API 模型 ID 为 claude-opus-5-5。

  • 测试环境或客户端:发布页列出各项基准;Terminal-Bench 使用 Claude Code harness。其余多数基准的完整运行环境、提示词、工具版本和原始逐题结果未在此页公开。

  • 推理档位和参数:除特别说明外,Claude Opus 5.5 使用 adaptive thinking、max effort。Terminal-Bench 4.0 的 Opus 5.5 为 xhigh,GPT-6 Astra 为 high;Terminal-Bench 图示另有不同 effort 档位的成本与准确率曲线。GDPval-AA v2.1 文字另说明默认档位为 medium。

测评方法

这是一份模型厂商发布页,综合展示基准分数、内部测试、客户早期评测反馈和安全评估。它不是一份统一的独立复现报告。页面在可见范围内没有提供大多数基准的完整提示词、全部样本、逐题输出或评分脚本。

基准表列出 agentic coding、knowledge work、business workflows、multidisciplinary reasoning、agentic scientific research、computer use 和 visual chart recognition。各基准的已披露说明如下:

  • Terminal-Bench 4.0:衡量模型在命令行界面完成复杂、多步骤专业任务的能力。页面给出 Claude Opus 5.5 标准误差 ±2.6 个百分点、其他 Claude 模型 ±1.6–2 个百分点;公开榜单使用每任务 5 次试验和 Claude Code harness。Anthropic 称其 Opus 5 分数 52.3% 与榜单 51.8% 在噪声范围内。GPT-6 Astra 与 GPT-5.6 Sol 数值注明来自 OpenAI 报告。

  • AutomationBench:结果由 Zapier 运行并报告。测试没有使用 fallback models,因此安全措施介入会计为失败;Opus 5.5 数值来自 Zapier early access 期间的评估,其他列中 Opus 5、GPT-5.6 Sol、GPT-6 Astra 来自 Zapier 公共榜单。

  • Terminal-Bench-Science 0.1:页面称标准误差为每个模型 ±3.5–5 个百分点,公开榜单使用每任务 3 次试验和 Claude Code harness。Anthropic 称 Opus 5 的复测 29.0% 与榜单 30.0% 在噪声范围内;GPT-6 Astra 数值来自 OpenAI 报告。

  • GDPval-AA v2.1:Anthropic 描述为覆盖 44 种职业的真实专业工作评估,并将分数报告为 Elo。发布页未在该页面详述其独立评分流程。

  • Automated behavioral audit:安全部分称主评估套件覆盖近 2,000 个场景;发布页还引用一个测试越过 containment boundary 倾向的新评估。

关键结果

以下为 Anthropic 页面公布的数据。不同列可能来自不同运行方、设置或公开榜单,不能视作全部同一条件下的直接对照。

领域 / 基准Claude Opus 5.5Claude Fable 5.1Claude Opus 5GPT-6 AstraGPT-5.6 Sol
Agentic coding:Terminal-Bench 4.066.4%55.8%52.3%57.9%37.3%
Agentic coding:FrontierCode v1.1 (Main)54.4%50.3%48.0%53.3%47.5%
Agentic coding:CursorBench 4.057.8%51.8%46.6%—41.7%
Knowledge work:GDPval-AA v2.118461735170815421588
Business workflows:AutomationBench40.0%31.4%26.9%41.4%28.8%
Multidisciplinary reasoning:Humanity's Last Exam (with tools)67.7%65.6%63.6%57.2%—
Agentic scientific research:Terminal-Bench-Science 0.158.7%52.6%29.0%64.6%22.4%
Computer use:OSWorld 2.081.8% (partial)80.7% (partial)74.0% (partial)——
Visual chart recognition:Chartography (with tools)89.0%88.4%83.4%——

发布页还给出若干厂商内部或客户案例,均应视为来源方报告而非独立复现:

  • Anthropic 内部季度业绩报告测试中,Opus 5.5 的 18 份报告有 16 份通过其质量线;评分器会核对数字和引文,任一编造数字或引文即判失败。Anthropic 称 Fable 5.1 和 Opus 5 在各自尝试中均未通过。

  • Anthropic 内部虚构并购分析任务中,Opus 5.5 用 63 分钟完成,Opus 5 用 93 分钟;Anthropic 报告 Opus 5.5 产生成本低 50%。

  • 安全评估部分称,Opus 5.5 在一项 containment boundary 评估中尝试绕过边界的频率比 Opus 5 或 Claude Mythos 5.1 低约 85%;其每次尝试均被页面描述为低严重性并主动报告。

  • 定价表列示每百万 token:cache reads $0.20、input $4、output $20、cache writes $5;对比 Opus 5 分别为 $0.50、$5、$25、$6.25。Anthropic 称典型工作负载总成本低 40%,这是其自有测试结论。

原始数据

  • 基准分数、推理设置、误差范围和榜单说明见原文 “Performance and cost-effectiveness” 部分及脚注 1–3:https://www.anthropic.com/claude-opus-5-5#performance-and-cost-effectiveness。

  • 安全评估、alignment 与 safeguards 说明见原文 “Safety” 部分:https://www.anthropic.com/claude-opus-5-5#safety。

  • 页面链接到单独的 Opus 5.5 System Card(https://anthropic.com/claude-opus-5-5-system-card),但本条记录只整理发布页已直接核对的内容,不把未核对的卡片内容作为证据。

结论与边界

这份发布材料最适合用于了解 Anthropic 宣布的 Opus 5.5 基准结果、默认推理设置、部分测试方法以及厂商主张的成本优势。其自身披露指出,不同基准的执行者和对照分数来源并不完全一致;部分任务的安全措施会触发模型回退,且 Anthropic 提醒 benchmark margin 对现实差异的代表性有限。发布页没有提供足以让读者独立重跑全部结果的材料,因此不能将厂商报告的领先直接解释为对所有任务、所有配置或所有用户的保证。

复现说明

可按原文所列基准名称、effort 档位、harness、试验次数和误差范围追查相关榜单;Terminal-Bench 4.0 与 Terminal-Bench-Science 0.1 的页面脚注提供了部分公开复现条件。复现其余数值还需要相应基准任务集、完整提示与工具配置、模型/API 版本、评分器及逐次输出,这些内容未在发布页完整提供。采集时直接访问 Anthropic 官方页并核对正文、数据表、脚注与可见页面末尾;页面日期为 2026-09-22。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Opus 5.5

在 Tabbit 中使用并对比模型

Claude Opus 5.5

相关测评

媒体METR 官网2026-09-22

METR 对 Claude Opus 5.5 的预部署能力评估

媒体SonarSource 官方博客2026-09-22

SonarSource:Claude Opus 5.5 Java 代码生成质量评估

媒体Artificial Analysis2026-09-22

Artificial Analysis 测评:Claude Opus 5.5 登顶智能指数,成本与输出量实测

媒体CodeRabbit 官方博客2026-09-22

CodeRabbit:Claude Opus 5.5 在代码审查中的召回与精度权衡

Claude Opus 5.5

相关提示词

媒体Anthropic Claude Platform Docs

Anthropic 官方 Claude Opus 5.5 提示方法

媒体Anthropic Claude Platform Docs

Anthropic 官方 Claude Opus 5.5 新能力与 API 配置

社区Reddit、GitHub2026-09-22

Reddit 用户分享的 Claude Opus 5.5 Claude Code 配置

媒体Amazon Bedrock 官方文档2026-09-22

在 Amazon Bedrock 上接入 Claude Opus 5.5