Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评
媒体Claude Sonnet 5.5

Artificial Analysis:Claude Sonnet 5.5 的智能指数与 Agent 任务独立测评

原始来源

Artificial Analysis

作者Artificial Analysis Team

原文日期2026-09-28

Tabbit 整理2026-09-28

查看原文

一句话结论

Artificial Analysis 的独立测评显示,Claude Sonnet 5.5 在 max effort 下以 56 分进入 Artificial Analysis Intelligence Index 第 2 名,并在终端 Agent 与知识工作任务上接近 Opus 5.5,但代价是该站测得最高的输出 token 用量和更高的单任务成本。

适用场景

  • 适合的任务:需要终端工具、代码执行、真实工作流和较长推理链的 Agent 任务;Terminal-Bench 4.0、AA-Briefcase、GDPval-AA 和 AutomationBench-AA 是较有参考价值的方向。

  • 不适合的任务:对事实准确率、科学推理或成本上限极敏感,却没有额外预算和结果核验的生产流程。

  • 适用的模型版本:Claude Sonnet 5.5 预发布部署(Artificial Analysis 文章快照);文章不是公开版本的最终回归结果。

  • 适用的客户端、Agent 或 API:Artificial Analysis 的 Intelligence Index 评测环境;文章未公开可直接复制的 API 调用脚本或完整工具 schema。

  • 推荐的推理档位和参数:文章比较了 low、medium、high、xhigh、max 五档,并启用 Anthropic 默认 fallback。若复测,应逐档固定 effort、fallback、工具集、超时和 token 上限。

测试环境与输入/配置

  • 评测主体:Artificial Analysis Intelligence Index,覆盖终端 Agent、知识工作、自动化、科学编码、事实知识和长上下文等任务。

  • 模型输入与上下文:文章列出 1M token 上下文,并支持文本和图像输入;这些是模型规格,不是本次评测实际使用的上下文长度。

  • 对比模型:Claude Opus 5.5、Claude Sonnet 5、GPT-6 Astra 和 GPT-6 Sol 等;不同任务使用各自的评测 harness,不能把所有数字视为同一套题目的单一总分。

  • 推理档位:Sonnet 5.5 的 low、medium、high、xhigh、max 五档,启用 Anthropic 默认 fallback。

  • fallback:Artificial Analysis 观察到约 0.1% 的 Intelligence Index 任务发生 fallback,文章称这些情况均回落到 Sonnet 5,主要出现在 Terminal-Bench 4.0。

  • 预发布边界:被测部署存在会降低 structured outputs 请求质量的 bug。Anthropic 在公开发布前修复了该问题,并预计最终结果变化很小或此前结果略被低估;Artificial Analysis 表示会重新运行相关评测。

  • 价格背景:文章记录 Sonnet 5.5 与 Sonnet 5 同价:输入 $2、输出 $10、cache write $2.5、cache read $0.2(每百万 token)。

结果数据

Intelligence Index 与 Agent 任务

评测Claude Sonnet 5.5对照或说明
Artificial Analysis Intelligence Index(max)56仅次于 Claude Opus 5.5(max)的 58;比 Sonnet 5(max)高 18 分
Terminal-Bench 4.0(max)64%Opus 5.5 为 60%,GPT-6 Astra(xhigh)为 60%
Terminal-Bench-Science(max)53%排在 GPT-6 Astra 与 Opus 5.5 之后;该评测当时未计入 Intelligence Index
AA-Briefcase1811 EloOpus 5.5 为 1822 Elo,接近持平
GDPval-AA1844 EloOpus 5.5 为 1846 Elo,接近持平
AutomationBench-AA71%Opus 5.5 为 70%,为文章所列 headline score

Token、成本与知识准确率

  • 输出 token:max 下每个 Intelligence Index 任务约 193k output tokens,是 Artificial Analysis 当时测到的最高值;约比 Opus 5.5(max)或 Sonnet 5(max)高 60%,约为 GPT-6 Astra(max)的 7 倍。

  • 单任务成本:文章称 Sonnet 5.5 约 $7.60/任务,比 Sonnet 5 的单任务成本高约 50%;在 Intelligence 与 Cost per Task 的权衡中,high effort 最有竞争力,但仍略落后于成本相近的 GPT-6 Sol。较低 effort 档位需分别比较质量与成本。

  • AA-Omniscience 事实准确率:Sonnet 5.5 为 54%,Opus 5.5 为 66%。

  • AA-Omniscience 幻觉率:Sonnet 5.5 为 47%,Opus 5.5 为 59%;此指标越低越好,不能直接当成事实答对率。

  • Humanity's Last Exam 与 SciCode:文章称 Sonnet 5.5 约比 Opus 5.5 低 6 分,但没有在正文中给出这两项的完整逐项分数表。

结论

在 Artificial Analysis 的测量中,Sonnet 5.5 把 Sonnet 系列在终端使用和 Agent 工作流上的表现推到了接近 Opus 5.5 的区间:Terminal-Bench 4.0 为 64%,AA-Briefcase、GDPval-AA 和 AutomationBench-AA 也接近或略高于 Opus 5.5。它的主要交换条件是极高的输出 token 用量;因此选型时应把每任务成本、延迟和上下文预算与能力分开评估。知识准确率和科学推理仍低于 Opus 5.5,不能因总指数排名靠前而省略事实核验。

局限

  • 文章测的是预发布部署,structured outputs bug 已在公开发布前修复;相关结果需要等待 Artificial Analysis 的重新评测。

  • Artificial Analysis 未在文章中公开每个任务的完整 prompt、样本量、温度、工具 schema、逐轮轨迹和原始输出,因此可以复核结论与主要指标,不能仅凭文章完全复跑。

  • Intelligence Index、Terminal-Bench、GDPval-AA、AutomationBench-AA、AA-Omniscience 等使用不同任务集和评分方法,不能把分数直接横向当作统一成功率。

  • 文章给出的约 $7.60 单任务成本来自其采集快照;模型价格、token 用量、provider 路由和缓存命中会改变实际成本。

  • fallback 比例、token 用量和榜单位置都依赖当时的模型部署与 Artificial Analysis harness,不能无条件外推到其他 API provider、客户端或自建 Agent。

复现步骤

  1. 固定公开版本的 Claude Sonnet 5.5 API snapshot、provider、effort 档位、默认 fallback 行为和 token 上限。

  2. 按同一套 Agent harness 分别复测 Terminal-Bench 4.0、Terminal-Bench-Science、AA-Briefcase 风格知识工作、GDPval-AA 风格办公任务和 AutomationBench-AA 风格 SaaS 流程。

  3. 为每个任务保存输入、工具调用、输出 token、reasoning token、延迟、失败类型、人工修正和成本;至少重复多次以估计方差。

  4. 另行测量 AA-Omniscience 风格事实准确率与幻觉率,并将事实错误与安全拒答分开统计。

  5. 将复测结果与本文的 56 分、64%、1811 Elo、1844 Elo、71% 等快照指标并列报告,不把自己的结果标成 Artificial Analysis 原始成绩。

来源摘录或观察(仅做合规短引)

文章的核心观察是 Sonnet 5.5 在 max 档接近 Opus 5.5,却使用了约 193k output tokens/任务;这组结论必须与对应的评测 harness 和预发布版本边界一起引用。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Sonnet 5.5

在 Tabbit 中使用并对比模型

Claude Sonnet 5.5

相关测评

媒体Anthropic 官方网站

Claude Sonnet 5.5 官方能力基准与适用边界

社区X / Arena.ai2026-09-30

Arena.ai Code Arena:Claude Sonnet 5.5 High 的 WebDev 真实任务排名

媒体CodeRabbit 官方博客2026-09-28

CodeRabbit:Claude Sonnet 5.5 与 Sonnet 5、Opus 5.5 的代码审查比较

媒体Bito 官方博客2026-09-29

Bito:Claude Sonnet 5.5 与 Sonnet 5 的四次 Agent 编码任务对比

Claude Sonnet 5.5

相关提示词

媒体Claude Platform Docs

Anthropic 官方提示指南:Claude Sonnet 5.5 的 effort、主动性与工具调用

媒体Claude Platform Docs

Anthropic 官方迁移指南:Claude Sonnet 5.5 API 配置与 breaking changes

媒体Claude Platform Docs2026-09-28

Anthropic 官方模型概览:Claude Sonnet 5.5 当前配置

社区GitHub(由 Reddit r/ClaudeAI 帖子提供的原始文件)

社区配置:面向 Claude Sonnet 5.5 的 CLAUDE.md 工作规则