Claude Sonnet 5.5

Claude Sonnet 5.5 模型测评导航

汇总 Claude Sonnet 5.5 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。

7 条已核对来源的资料官方 · 媒体 · 社区

媒体

4 条已核对来源的资料
媒体Anthropic 官方网站

Claude Sonnet 5.5 官方能力基准与适用边界

Anthropic 的发布页显示,Claude Sonnet 5.5 在其选取的 Agent 编码、知识工作、电脑使用和图表识别基准上大幅超过 Sonnet 5,并以与 Sonnet 5 相同的标价和更少的任务 token 实现最高 30% 的单任务成本下降;这些结果是厂商发布材料,部分评测运行条件、完整样本和原始输出未公开。

媒体Artificial Analysis

Artificial Analysis:Claude Sonnet 5.5 的智能指数与 Agent 任务独立测评

Artificial Analysis 的独立测评显示,Claude Sonnet 5.5 在 max effort 下以 56 分进入 Artificial Analysis Intelligence Index 第 2 名,并在终端 Agent 与知识工作任务上接近 Opus 5.5,但代价是该站测得最高的输出 token 用量和更高的单任务成本。

媒体CodeRabbit 官方博客

CodeRabbit:Claude Sonnet 5.5 与 Sonnet 5、Opus 5.5 的代码审查比较

在 CodeRabbit 的 13 个已知缺陷案例中,Sonnet 5.5 thinking on 比 Sonnet 5 多捕获 2 个问题,actionable precision 几乎相同;在 44 个真实开源 PR 上,Sonnet 5.5 平均审查耗时约为 Sonnet 5 的一半、评论少 24%,但大样本的 judge scoring 尚未完成,不能把评论量直接解释为质量。

媒体Bito 官方博客

Bito:Claude Sonnet 5.5 与 Sonnet 5 的四次 Agent 编码任务对比

Bito 在自有服务的 Agent 编码任务上让每个任务、每个模型重复运行四次,并用 50 分制和 Opus 5.5 评分;在各自 Claude Code 默认设置下,Sonnet 5.5 平均得分 38.5 对 Sonnet 5 的 33.3,单次 session 成本约低 71%,耗时约为三分之一,但默认 effort 不同且任务、提示词和评分实现未完整公开。

社区

3 条已核对来源的资料

Claude Sonnet 5.5

在 Tabbit 中使用并对比模型

汇总 Claude Sonnet 5.5 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。