Claude Sonnet 5

Claude Sonnet 5 · 测评与证据

Claude Sonnet 5,哪些结论值得看?

按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。

这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。

编辑结论

编辑结论

模型:Claude Sonnet 5,与 Sonnet 4.6、Opus 4.8 对比。 评测:官方展示 BrowseComp(Agentic Search)与 OSWorld-Verified(computer use),并在系统卡中报告更多能力与安全评估。

Anthropic 官方博客 · 查看证据

在 Agent Security League 真实漏洞修复基准测试中,Claude Sonnet 5 与 Claude Code 组合展现出顶尖的功能修复率(FuncPass 83.2%),但在安全漏洞真正闭环率上处于中上游(SecPass 19.6%),且表现出极低的作弊率与高诚实度。

Endor Labs · 查看证据

CodeRabbit 基于生产级代码审查 Harness 与日常研发实测表明:Sonnet 5 在自主代码编写上具备极强的评估自纠循环;在 PR 审查上评论精准度大幅提升至 38%-40%,但严格找 Bug 召回率略有下降,适合用于减少人工审查疲劳。

CodeRabbit 官方博客 · 查看证据

完整测评与相关内容

模型深度阅读

总览 · 简体中文

Claude Sonnet 5:有哪些变化,如何获取

以官方资料说明 Claude Sonnet 5 的定位、与 Sonnet 4.6 的变化、获取方式、限制、成本边界和适用场景。

精选证据

媒体 / 基准方编辑分析

Claude Sonnet 5 官方发布:Agent 能力、成本档位与安全边界

模型:Claude Sonnet 5,与 Sonnet 4.6、Opus 4.8 对比。 评测:官方展示 BrowseComp(Agentic Search)与 OSWorld-Verified(computer use),并在系统卡中报告更多能力与安全评估。

来源Anthropic 官方博客
原文日期2026-06-30
采集2026-08-18

待验证:本次未能重新核实原文。

条件
版本 Sonnet 5;来源 2026-06-30,价格页更新 2026-08-10;任务为 BrowseComp、OSWorld-Verified 等官方项目;prompt、重复和 harness 未公开。
推理能力
媒体 / 基准方编辑分析

Endor Labs 独立评测:Claude Sonnet 5 搭配 Claude Code 的功能正确性与安全修复表现

在 Agent Security League 真实漏洞修复基准测试中,Claude Sonnet 5 与 Claude Code 组合展现出顶尖的功能修复率(FuncPass 83.2%),但在安全漏洞真正闭环率上处于中上游(SecPass 19.6%),且表现出极低的作弊率与高诚实度。

来源Endor Labs
原文日期2026-07-02
采集2026-08-18

待验证:本次未能重新核实原文。

条件
版本 Sonnet 5 + Claude Code;Agent Security League 真实漏洞修复任务;报告 2026-07-02;FuncPass 83.2%、SecPass 19.6%,本站未重跑。
推理能力
媒体 / 基准方编辑分析

CodeRabbit 生产实测:Claude Sonnet 5 代码编写与 PR 审查质量深度对比

CodeRabbit 基于生产级代码审查 Harness 与日常研发实测表明:Sonnet 5 在自主代码编写上具备极强的评估自纠循环;在 PR 审查上评论精准度大幅提升至 38%-40%,但严格找 Bug 召回率略有下降,适合用于减少人工审查疲劳。

来源CodeRabbit 官方博客
原文日期2026-06-30
采集2026-08-18

待验证:本次未能重新核实原文。

条件
版本 Sonnet 5;CodeRabbit 生产代码审查 harness;报告 2026-06-30;PR 评论精确度约 38%–40%,抽样、重复和基线未完整公开。
推理能力
媒体 / 基准方编辑分析

Vellum 基准横评:Claude Sonnet 5 六大基准得分、Tokenizer 变化与成本分析

Vellum 深度拆解 Anthropic 官方及第三方数据表明:Sonnet 5 在终端控制(80.4%)和知识工作(1,618 分)上甚至超越旗舰 Opus 4.8,但在高 effort 和新 Tokenizer 下单位任务 Token 膨胀明显,选型需结合实际任务成本。

来源Vellum 官方博客
原文日期2026-06-30
采集2026-08-18

待验证:本次未能重新核实原文。

条件
版本 Sonnet 5;Vellum 汇总六类官方/第三方基准,日期 2026-06-30;terminal control 80.4%、知识工作 1,618 分,题集和重复不统一。
推理能力

全部来源

全部来源

6 / 6
媒体 / 基准方编辑分析

Claude Sonnet 5 官方发布:Agent 能力、成本档位与安全边界

模型:Claude Sonnet 5,与 Sonnet 4.6、Opus 4.8 对比。 评测:官方展示 BrowseComp(Agentic Search)与 OSWorld-Verified(computer use),并在系统卡中报告更多能力与安全评估。

来源Anthropic 官方博客
原文日期2026-06-30
采集2026-08-18

待验证:本次未能重新核实原文。

条件
版本 Sonnet 5;来源 2026-06-30,价格页更新 2026-08-10;任务为 BrowseComp、OSWorld-Verified 等官方项目;prompt、重复和 harness 未公开。
推理能力
媒体 / 基准方编辑分析

Endor Labs 独立评测:Claude Sonnet 5 搭配 Claude Code 的功能正确性与安全修复表现

在 Agent Security League 真实漏洞修复基准测试中,Claude Sonnet 5 与 Claude Code 组合展现出顶尖的功能修复率(FuncPass 83.2%),但在安全漏洞真正闭环率上处于中上游(SecPass 19.6%),且表现出极低的作弊率与高诚实度。

来源Endor Labs
原文日期2026-07-02
采集2026-08-18

待验证:本次未能重新核实原文。

条件
版本 Sonnet 5 + Claude Code;Agent Security League 真实漏洞修复任务;报告 2026-07-02;FuncPass 83.2%、SecPass 19.6%,本站未重跑。
推理能力
媒体 / 基准方编辑分析

CodeRabbit 生产实测:Claude Sonnet 5 代码编写与 PR 审查质量深度对比

CodeRabbit 基于生产级代码审查 Harness 与日常研发实测表明:Sonnet 5 在自主代码编写上具备极强的评估自纠循环;在 PR 审查上评论精准度大幅提升至 38%-40%,但严格找 Bug 召回率略有下降,适合用于减少人工审查疲劳。

来源CodeRabbit 官方博客
原文日期2026-06-30
采集2026-08-18

待验证:本次未能重新核实原文。

条件
版本 Sonnet 5;CodeRabbit 生产代码审查 harness;报告 2026-06-30;PR 评论精确度约 38%–40%,抽样、重复和基线未完整公开。
推理能力
媒体 / 基准方编辑分析

Vellum 基准横评:Claude Sonnet 5 六大基准得分、Tokenizer 变化与成本分析

Vellum 深度拆解 Anthropic 官方及第三方数据表明:Sonnet 5 在终端控制(80.4%)和知识工作(1,618 分)上甚至超越旗舰 Opus 4.8,但在高 effort 和新 Tokenizer 下单位任务 Token 膨胀明显,选型需结合实际任务成本。

来源Vellum 官方博客
原文日期2026-06-30
采集2026-08-18

待验证:本次未能重新核实原文。

条件
版本 Sonnet 5;Vellum 汇总六类官方/第三方基准,日期 2026-06-30;terminal control 80.4%、知识工作 1,618 分,题集和重复不统一。
推理能力
社区个人体验

Reddit 社区:Claude Sonnet 5 发布后任务体验与成本争议

用户环境:Claude Max 5x、Claude 产品内存与项目上下文;具体 API 参数、任务集和工具 harness 未统一公开。 代表性任务:数据管道架构头脑风暴、前端实现、Azure 认证学习、代码审查和网页搜索。

来源Reddit,r/ClaudeAI
原文日期2026-06-30
采集2026-08-18

待验证:本次未能重新核实原文。

来源/版本
Reddit 社区:Claude Sonnet 5 发布后任务体验与成本争议;动态状态按原文,本轮未重开
任务/样本
personal-experience;任务、样本和重复以公开部分为准
环境/harness
provider、客户端、参数与工具 harness 未统一公开
推理能力
社区个人体验

Reddit 社区:基于 DeepSWE 基准的 Sonnet 5 任务步数与高 Effort 成本陷阱分析

社区基于 Datacurve DeepSWE 复杂编码基准讨论指出:Sonnet 5 虽然单 token 费率较低,但在高难度长链路任务中往往需要更多步数和试错循环,若盲目开启高 effort 档位,其实际单任务成本反而可能劣于 Opus 4.8。

来源Reddit,r/ClaudeAI
原文日期2026-07-03
采集2026-08-18

待验证:本次未能重新核实原文。

来源/版本
Reddit 社区:基于 DeepSWE 基准的 Sonnet 5 任务步数与高 Effort 成本陷阱分析;动态状态按原文,本轮未重开
任务/样本
personal-experience;任务、样本和重复以公开部分为准
环境/harness
provider、客户端、参数与工具 harness 未统一公开
推理能力

Claude Sonnet 5

在 Tabbit 中比较 Claude Sonnet 5

客户端中的模型、功能和权限以当前账户为准。