Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评
媒体Claude Opus 5.5

Artificial Analysis 测评:Claude Opus 5.5 登顶智能指数,成本与输出量实测

原始来源

Artificial Analysis

作者Artificial Analysis

原文日期2026-09-22

Tabbit 整理2026-09-22

查看原文

一句话结论

Artificial Analysis 的 2026-09-22 截面中,Claude Opus 5.5 的 max 档以 Intelligence Index 58 分列榜首,强项集中在知识工作和多项 Agent 评测,但输出量较大,单项指数任务成本约为 5.98 美元。

适用场景

  • 适合判断的任务:综合推理与知识、Agent 知识工作、终端编程、代码科学任务、自动化工作流;也可比较不同 effort 档位下的指数分数、输出量与估算任务成本。

  • 不适合外推的任务:未纳入这十项指数评测的任务、特定企业私有工作流、其他推理参数或 Agent 配置;AA-Briefcase 含私有评测集,不能仅凭公开摘要独立复跑其结果。

  • 适用的模型版本:Claude Opus 5.5;Artificial Analysis 模型页显示的测试变体为 Adaptive Reasoning,并启用 Anthropic 默认 fallback。

  • 测试环境或客户端:Artificial Analysis 自有评测;AA-Briefcase 使用其开源参考 Agent harness Stirrup。文章未给出其余评测的完整执行配置、逐项输入或提交记录。

  • 推理档位和参数:low、medium、high、xhigh、max 五档;文章称 Intelligence Index 五档均启用了 Anthropic 默认 fallback。文章未注明其他推理参数。

测评方法

Artificial Analysis Intelligence Index v4.3.2 汇总十项评测:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。指数版本及评测清单来自同一机构的模型页;榜单和成本均为采集日可见的动态快照。

文章覆盖五种 effort 档位的指数测评。它特别说明 AA-Briefcase v1.1 是 Artificial Analysis 的私有前沿知识工作评测,通过开源参考 Agent harness Stirrup 评估模型能否生成准确、呈现良好的专业产物。Artificial Analysis 的方法说明将单项任务成本定义为按指数权重汇总输入、缓存和输出 token 的加权平均;因此成本同时受价格和 token 消耗影响。

文章没有公开十项评测的完整提示词、各项样本数、模型调用日志或各 effort 档的完整逐项成绩。除 AA-Briefcase 外,本文不推断各评测使用的具体 Agent harness。

关键结果

  • 综合指数:Claude Opus 5.5 max 得分 58,为文章所述当时最高分;模型页采集时也显示 #1 / 212。这个排名对应 v4.3.2 的当日快照,不代表永久排名。

  • 领先的六项:Humanity's Last Exam 61.4%(此前最高为 Claude Fable 5.1 的 59.1%)、SciCode 66.9%(此前最高为 Fable 5.1 的 63.1%)、GDPval-AA v2.1、AA-Briefcase v1.1、AA-Omniscience、AutomationBench-AA。文章未列出其余三项的完整数值。

  • 终端与代码:Terminal-Bench 4.0 为 59.6%,与 GPT-6 Astra xhigh 并列领先,比 Opus 5 高 11 个百分点。模型仍落后于其他模型的项目包括 CritPt、AA-LCR 和 GDP.pdf。

  • Agent 知识工作:AA-Briefcase v1.1 为 1,822 Elo,比 Fable 5.1 高 143;分析质量与呈现子分均领先,但 rubric 评分略低于 Fable 5.1。GDPval-AA v2.1 为 1,846 Elo,比 Fable 5.1 高 111、比 Opus 5 高 138。

  • 档位与成本前沿:五档中 max、xhigh、high、medium 四档位于 Intelligence 对单项任务成本的 Pareto 前沿;文章将比较范围描述为指数分数 50 以上的模型。

  • 输出量与单项成本:max 档每项指数任务约生成 119k output tokens,Opus 5 max 约 73k、Fable 5.1 max 约 78k、GPT-6 Astra max 约 27k。模型页采集快照显示加权平均每项指数任务成本为 $5.98。

  • 评测总费用与累计输出量:模型页显示完整 Intelligence Index 测评总成本为 $8,708.20,累计生成 260M output tokens。累计量与文章的每任务约 119k 属于不同统计口径,不能互相替代。

  • 价格与上下文:Artificial Analysis 页面列出的 API 价格为每百万输入 token $4、输出 token $20、cache read $0.20;1M token 上下文,支持文本和图像输入、文本输出。页面称相比 Opus 5 的 $5/$25 输入/输出价格下降 20%,cache read 从 $0.50 降至 $0.20。价格是页面所列 API 定价信息,不是独立基准测出的模型能力。

原始数据

指标Claude Opus 5.5 结果对比或口径
Artificial Analysis Intelligence Index58(max)v4.3.2,模型页采集快照排名 #1 / 212
Humanity's Last Exam61.4%Fable 5.1 此前最高 59.1%
SciCode66.9%Fable 5.1 此前最高 63.1%
Terminal-Bench 4.059.6%与 GPT-6 Astra xhigh 并列;比 Opus 5 高 11 个百分点
AA-Briefcase v1.11,822 Elo比 Fable 5.1 高 143
GDPval-AA v2.11,846 Elo比 Fable 5.1 高 111;比 Opus 5 高 138
Intelligence Index 单项任务输出约 119k tokensOpus 5 max 约 73k;Fable 5.1 max 约 78k;GPT-6 Astra max 约 27k
加权平均单项任务成本$5.98模型页所示采集快照
完整指数评测总成本$8,708.20模型页所示采集快照
指数评测累计输出260M tokens模型页所示累计口径
API 价格输入 $4 / 输出 $20 / cache read $0.20,每百万 tokenArtificial Analysis 页面列价;非能力测评结果

结论与边界

这份测评支持将 Opus 5.5 max 视为当时 Artificial Analysis 指数中的综合领先模型之一,尤其适合重视 Agent 知识工作质量的场景。Terminal-Bench 4.0 的结果显示其与 GPT-6 Astra xhigh 接近,但每项指数任务输出约为 Astra max 的四倍以上;实际成本还取决于请求长度、缓存命中、价格和工作流。

结论应限定在 Artificial Analysis 的 v4.3.2 指数与 2026-09-23 可见快照。十项评测的覆盖面不能代表所有工作;AA-Briefcase 是私有测试集,且文章未披露完整输入、逐项数据和运行日志,外部读者无法完整复现排名。文章报告的价格变化属于页面披露的定价信息,应与独立测出的基准表现分开理解。

复现说明

可先在 Artificial Analysis 模型页核对 Intelligence Index 版本、评测组成、模型变体与当日动态数据;再依照其方法说明理解加权任务成本口径。要严格复现分数,需要取得各项 benchmark 的版本、完整提示词、样本与权重、fallback 行为、工具配置及运行日志;文章没有全部提供。AA-Briefcase 使用 Stirrup,但评测集私有,因此其 Elo 不能据本文完整复跑。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Opus 5.5

在 Tabbit 中使用并对比模型

Claude Opus 5.5

相关测评

媒体Anthropic 官方网站2026-09-22

Claude Opus 5.5 官方能力基准与适用边界

媒体METR 官网2026-09-22

METR 对 Claude Opus 5.5 的预部署能力评估

媒体SonarSource 官方博客2026-09-22

SonarSource:Claude Opus 5.5 Java 代码生成质量评估

媒体CodeRabbit 官方博客2026-09-22

CodeRabbit:Claude Opus 5.5 在代码审查中的召回与精度权衡

Claude Opus 5.5

相关提示词

媒体Anthropic Claude Platform Docs

Anthropic 官方 Claude Opus 5.5 提示方法

媒体Anthropic Claude Platform Docs

Anthropic 官方 Claude Opus 5.5 新能力与 API 配置

社区Reddit、GitHub2026-09-22

Reddit 用户分享的 Claude Opus 5.5 Claude Code 配置

媒体Amazon Bedrock 官方文档2026-09-22

在 Amazon Bedrock 上接入 Claude Opus 5.5