如果工作需要持续调用工具、编码和多步跟进,Claude Sonnet 5 值得进行受控试用。它适合先处理边界清楚的智能体任务和知识工作:这些任务可能需要接近 Opus 的能力,却受成本或可用性约束。若更看重缺陷召回、最快收敛或专用工具入口,仍应把 Sonnet 4.6 或更大模型放在对照组中。
Anthropic 于 2026 年 6 月 30 日发布 Claude Sonnet 5。当前模型 ID 是 claude-sonnet-5;本文以 Anthropic 发布说明和 Claude Platform 目录为决策锚点,并于 2026 年 9 月 20 日核对。关键不只是“版本更新”:effort、工具和实际暴露模型的入口共同决定成本与结果。(Anthropic,Claude Platform)
关键结论
Sonnet 5 是更强调智能体工作的 Sonnet,面向计划、工具、编码和多步骤专业任务。
目录快照列出
claude-sonnet-5、自适应思考、100 万 token 上下文和 12.8 万 token 最大输出;不是每个客户端都保证开放这些控制。当前 API 快照为每百万输入 token 2 美元、输出 10 美元。effort、思考 token 和重试增加后,单任务成本仍会升高。
公开评测是有条件的:Terminal-Bench 和知识工作结果接近 Opus 4.8,但 CodeRabbit 在代码审查中观察到精准度与召回率的取舍。
本稿没有完成 Tabbit 中的 Sonnet 5 任务,也没有截图。请先查看 Claude Sonnet 5 模型资源 和自己的模型选择器。
Claude Sonnet 5 规格速览
下表把目录事实和获取判断分开。模型页列出能力与限制,但不保证消费者套餐、云平台或浏览器客户端暴露全部控制项。
| 问题 | 当前快照 | 选择边界 |
|---|---|---|
| 模型 ID | claude-sonnet-5 | 在 API 和评测日志中固定精确 ID。 |
| 发布日期 | 2026 年 6 月 30 日 | 版本比较必须保持任务和测试环境一致。 |
| 输入 / 输出 | 文本、图片输入;文本输出 | 工具和多模态行为取决于入口。 |
| 上下文 / 最大输出 | 100 万 token / 12.8 万 token | 目录上限,客户端有效限制可能更小。 |
| 思考 | 自适应;目录列出的默认 effort 为 high | 应比较 effort 档位,而不只比较模型名。 |
| API 价格快照 | 每百万输入 2 美元 / 输出 10 美元 | 订阅、云平台和 Tabbit 费用另算。 |
| 获取 | Anthropic 列出 Claude 套餐和 Claude API | 检查账户、地区、配额和实时选择器。 |
目录显示的可靠知识截止时间是 2026 年 1 月。这是目录元数据,不代表连接的工具或检索层保持最新。若要判断浏览器入口,智能体浏览器与普通聊天窗口的区别在于能否检查和操作实时网页;模型能力本身不会自动获得这些权限。
它比 Sonnet 4.6 变化了什么?
Anthropic 将升级重点放在智能体任务:更长的计划、浏览器和终端工具、编码、推理与知识工作。发布说明还称不良行为率低于 Sonnet 4.6,并默认启用网络安全防护。这些是厂商发布口径,应作为背景,而不是自己的任务结论。
| 维度 | Sonnet 4.6 | Sonnet 5 | 对读者的行动 |
|---|---|---|---|
| 智能体跟进 | 上一代 Sonnet 基线 | Anthropic 称可完成更多多步骤工作并检查结果 | 用明确停止条件和验收命令测试。 |
| 工具调用 | 能力取决于入口 | 发布重点是浏览器和终端工具 | 检查权限并记录每次工具调用。 |
| 终端工作 | Vellum/系统卡快照为 67.0% | 同一公开比较中 Terminal-Bench 2.1 为 80.4% | 这是公开评测,不是你的仓库重跑。 |
| 知识工作 | 同一比较中的上一代基线 | GDPval-AA v2 为 1,618,Opus 4.8 为 1,615 | 3 分差不能推出普遍胜负。 |
| 代码审查 | CodeRabbit 约 63% 严格召回、29% 精准度 | 约 50–51% 严格召回、38–40% 精准度 | 有意识地选择评论干净或覆盖更广。 |
| 安全 | Sonnet 4.6 基线 | Anthropic 称不良行为更少,默认开启网络安全防护 | 安全流程仍需人工复核和专门测试。 |
Vellum 还提醒,Anthropic 修订过部分 Sonnet 4.6 基线。不能把不同日期、评分器或工具配置的数字拼成一个排行榜。Claude Sonnet 5 测评资源收集了来源笔记,智能体推理指南说明为什么基准评测只能代表长流程的一部分。
仍然未知的事情
第一,公开评测不等于你的测试环境。Endor Labs 的 Agent Security League 报告显示,Sonnet 5 搭配 Claude Code 在功能正确性上较强,但漏洞闭环明显更弱。报告摘要写 83.2% FuncPass,正文写 82.6%,因此本文不把任何一个数字当作确定的标题事实。能迁移的结论更窄:通过功能测试的补丁不等于安全补丁。
第二,effort 会改变单任务成本。CodeRabbit 发现更高 effort 没有明显改善严格缺陷召回,却大约使审查成本翻倍。每百万 token 的价格不是任务预算;比较时要记录思考 token、重试、工具调用和人工修正。
第三,入口决定可用性。Anthropic 列出 Claude 套餐和 API,但实时选择器、地区、配额和工具集决定用户实际能做什么。API 能用不代表浏览器客户端或第三方提供商开放相同模型。
社区正在争论什么
Reddit 讨论暴露了发布页无法单独解决的选择。Exodus_Green 阅读公开图表后认为,Sonnet 4.6 的 low effort 可能在智能体搜索中超过 Sonnet 5 的 medium,尽管价格略高(原评论)。这提醒我们比较 effort 档位。
反方向的 Rent_South 用自己的逻辑流程评测,每个模型运行五次,结论是模型选择取决于工作流(同帖)。qubedView 把成本边界说得更具体:单任务成本才重要,Sonnet 处理单次文档抽取可能便宜得多,而 Opus 更适合困难编码(原讨论)。TheRealJesus2 建议拆分任务,让小模型负责低或中等推理,让大模型规划和验证(同讨论)。
这些是个人报告,不是基准评测。9 月 20 日尝试了 X 搜索和 YouTube 搜索,但浏览器会话没有暴露稳定、可归属的帖子或评论正文。本文不放截图,并继续保持草稿。
谁适合尝试?
| 如果你的工作是这样 | 第一步 | 原因 |
|---|---|---|
| 重复抽取、分类或路由 | 先用低/中 effort 试 Sonnet 5 | 社区信号和成本逻辑都更支持边界清楚的任务。 |
| 有测试和验收条件的多文件编码 | 开启工具,试运行 Sonnet 5 | 发布定位和独立报告都指向更好的跟进能力。 |
| 高风险安全审查 | 保留专用或更大模型 | 功能正确不等于漏洞闭环,仍需人工签字。 |
| 单行修改或强低延迟聊天 | 对照 Sonnet 4.6 或更快模型 | Sonnet 5 可能为小任务投入过多思考。 |
入口看不到 claude-sonnet-5 | 不要承诺可用,先查账户和地区 | 博客或目录中的模型名不是授权。 |
客户端也会改变任务形状。浏览器自动化不能消除模型限制、登录要求或复核职责。若团队比较的是产品而不是模型,可另看 AI 浏览器对比 和 AI 浏览器指南。
实际下一步:测量一个完成任务
选一个可回滚且有代表性的任务,例如从小型文档集中抽取字段,或带现有测试命令的多文件修改。记录:
精确模型 ID 和客户端;
effort、上下文大小和工具权限;
输入、输出和思考 token;
耗时、重试和工具调用;
结果是否通过独立检查;
是否需要人工修复或收尾。
再用 Sonnet 4.6 或当前模型运行相同测试样本。只有 Sonnet 5 在每个完成结果上更便宜,而不是每个 token 更便宜,才值得切换。Tabbit Browser 说明介绍浏览器工作流,Tabbit 实践说明如何保留人工参与。
本稿没有在 Tabbit 中测试 Sonnet 5,因此不声称任何已登录账户当前都能看到它。如果你的选择器出现该模型,先运行一个可回滚的小任务。入口适合时再下载:
结论
Claude Sonnet 5 值得在智能体编码、工具工作流和重复知识工作中进行受控试用。它的跟进能力和大上下文让它不只是 Sonnet 4.6 的小修订,但它不是自动替代 Opus 的答案,也不是安全保证或低成本保证。effort、重试、入口限制和任务拆分决定最终结果。
从满足验收条件所需的最低 effort 开始,记录每个完成任务的成本,只有在任务证明需要时才升级。真实 Tabbit 账户测试和所需社区截图完成前,本稿保持草稿。
来源
Anthropic:Introducing Claude Sonnet 5 — 发布日期、定位、获取、安全和价格快照。
Claude Platform 模型总览 — 模型 ID、上下文、输出、思考和目录元数据。
Claude Platform 定价 — 当前 API 价格参考。
Endor Labs:Claude Sonnet 5 with Claude Code — 安全与功能基准评测及局限。
CodeRabbit:Claude Sonnet 5 review — 生产代码审查测试环境和精准度/召回率取舍。
Vellum:Claude Sonnet 5 Benchmarks Explained — 定日期基准比较和分词器风险。
Reddit:Introducing Claude Sonnet 5 — effort 和工作流讨论。
Reddit:Why would anyone use Claude Sonnet 5? — 单任务成本和路由讨论。
常见问题
Claude Sonnet 5 是什么?
Claude Sonnet 5 是 Anthropic 面向编码、工具调用、知识工作和智能体流程的中档模型。2026 年 9 月 20 日核对的 Claude Platform 目录列出 API ID claude-sonnet-5、自适应思考、100 万 token 上下文和 12.8 万 token 最大输出。
Claude Sonnet 5 比 Sonnet 4.6 变化了什么?
Anthropic 将 Sonnet 5 定位为更具智能体能力的版本,重点是推理、工具调用、编码和知识工作。独立报告也显示取舍:在特定代码审查测试环境中,评论更干净,但严格缺陷召回可能下降。
Claude Sonnet 5 的上下文和输出上限是多少?
2026 年 9 月 20 日核对的 Claude Platform 模型目录列出 100 万 token 上下文和 12.8 万 token 最大输出。这是模型目录上限,具体客户端、套餐或提供商可能暴露不同的有效限制。
Claude Sonnet 5 多少钱?
当前 Claude Platform 快照列出每百万输入 token 2 美元、每百万输出 token 10 美元。API、消费者订阅、云平台和第三方加价分别计算,自适应思考也会改变单任务成本。
在哪里可以使用 Claude Sonnet 5?
Anthropic 的发布说明列出 Claude 各套餐和 Claude API。具体模型选择器、地区、配额和工具取决于使用入口,向团队承诺可用前应检查实时账户或提供商页面。
切换前应该怎样测试 Claude Sonnet 5?
选择一个有代表性的任务,记录模型 ID、effort 档位、工具调用、耗时、总 token,以及是否需要人工接管,再与 Sonnet 4.6 或当前模型比较。一次成功不能证明生产可靠性。