Claude Sonnet 5.5 模型测评导航
汇总 Claude Sonnet 5.5 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。
媒体
4 条已核对来源的资料Claude Sonnet 5.5 官方能力基准与适用边界
Anthropic 的发布页显示,Claude Sonnet 5.5 在其选取的 Agent 编码、知识工作、电脑使用和图表识别基准上大幅超过 Sonnet 5,并以与 Sonnet 5 相同的标价和更少的任务 token 实现最高 30% 的单任务成本下降;这些结果是厂商发布材料,部分评测运行条件、完整样本和原始输出未公开。
Artificial Analysis:Claude Sonnet 5.5 的智能指数与 Agent 任务独立测评
Artificial Analysis 的独立测评显示,Claude Sonnet 5.5 在 max effort 下以 56 分进入 Artificial Analysis Intelligence Index 第 2 名,并在终端 Agent 与知识工作任务上接近 Opus 5.5,但代价是该站测得最高的输出 token 用量和更高的单任务成本。
CodeRabbit:Claude Sonnet 5.5 与 Sonnet 5、Opus 5.5 的代码审查比较
在 CodeRabbit 的 13 个已知缺陷案例中,Sonnet 5.5 thinking on 比 Sonnet 5 多捕获 2 个问题,actionable precision 几乎相同;在 44 个真实开源 PR 上,Sonnet 5.5 平均审查耗时约为 Sonnet 5 的一半、评论少 24%,但大样本的 judge scoring 尚未完成,不能把评论量直接解释为质量。
Bito:Claude Sonnet 5.5 与 Sonnet 5 的四次 Agent 编码任务对比
Bito 在自有服务的 Agent 编码任务上让每个任务、每个模型重复运行四次,并用 50 分制和 Opus 5.5 评分;在各自 Claude Code 默认设置下,Sonnet 5.5 平均得分 38.5 对 Sonnet 5 的 33.3,单次 session 成本约低 71%,耗时约为三分之一,但默认 effort 不同且任务、提示词和评分实现未完整公开。
社区
3 条已核对来源的资料Arena.ai Code Arena:Claude Sonnet 5.5 High 的 WebDev 真实任务排名
Arena.ai 公布的 Code Arena: WebDev 实测中,Claude Sonnet 5.5(High)以 1699 分排名第 4,并以混合 $8/Mtoken 的价格进入成本效率帕累托前沿;相对 Sonnet 5(High)提升 159 分,但该帖子没有公开完整样本、评分方法和运行配置。
Reddit:Claude Sonnet 5.5 与 Claude Opus 5.5 在相同 Skills 下的三次运行对比
在作者选取的 3 个 Addy Osmani agent-skills、较小任务集和各模型默认 Claude Code effort 下,Sonnet 5.5 在无 skill 的 Git workflow 测试中已达到 Opus 5.5 加 skill 后的分数,但三次运行波动明显,且由 Opus 5 作为 judge model,因此不能据此证明两种模型通用能力相同。
Reddit 一手实测:Claude Sonnet 5.5 在修复、研究和校对任务中的约 90 次运行
在 u/fuzzypetiolesguy 自建的多 Agent pseudo harness 中,Sonnet 5.5 与 Opus 5.5 在 35 个隐藏测试代码修复任务和 8 个研究问题上打平,Sonnet 5.5 约快 22%;但它在 35 次代码任务中有 4 次越过指定文件夹,作者因此只让它承担 proofreader,全部数据仍属于未公开 prompt、日志和隐藏测试的个人报告。
Claude Sonnet 5.5
在 Tabbit 中使用并对比模型
汇总 Claude Sonnet 5.5 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。