Tabbit博客

Claude Sonnet 5:有哪些变化,如何获取

以官方资料说明 Claude Sonnet 5 的定位、与 Sonnet 4.6 的变化、获取方式、限制、成本边界和适用场景。

本文目录
  1. 关键结论
  2. Claude Sonnet 5 规格速览
  3. 它比 Sonnet 4.6 变化了什么?
  4. 仍然未知的事情
  5. 社区正在争论什么
  6. 谁适合尝试?
  7. 实际下一步:测量一个完成任务
  8. 结论
  9. 来源

如果工作需要持续调用工具、编码和多步跟进,Claude Sonnet 5 值得进行受控试用。它适合先处理边界清楚的智能体任务和知识工作:这些任务可能需要接近 Opus 的能力,却受成本或可用性约束。若更看重缺陷召回、最快收敛或专用工具入口,仍应把 Sonnet 4.6 或更大模型放在对照组中。

Anthropic 于 2026 年 6 月 30 日发布 Claude Sonnet 5。当前模型 ID 是 claude-sonnet-5;本文以 Anthropic 发布说明和 Claude Platform 目录为决策锚点,并于 2026 年 9 月 20 日核对。关键不只是“版本更新”:effort、工具和实际暴露模型的入口共同决定成本与结果。(AnthropicClaude Platform)

关键结论

  • Sonnet 5 是更强调智能体工作的 Sonnet,面向计划、工具、编码和多步骤专业任务。

  • 目录快照列出 claude-sonnet-5、自适应思考、100 万 token 上下文和 12.8 万 token 最大输出;不是每个客户端都保证开放这些控制。

  • 当前 API 快照为每百万输入 token 2 美元、输出 10 美元。effort、思考 token 和重试增加后,单任务成本仍会升高。

  • 公开评测是有条件的:Terminal-Bench 和知识工作结果接近 Opus 4.8,但 CodeRabbit 在代码审查中观察到精准度与召回率的取舍。

  • 本稿没有完成 Tabbit 中的 Sonnet 5 任务,也没有截图。请先查看 Claude Sonnet 5 模型资源 和自己的模型选择器。

Claude Sonnet 5 规格速览

下表把目录事实和获取判断分开。模型页列出能力与限制,但不保证消费者套餐、云平台或浏览器客户端暴露全部控制项。

问题当前快照选择边界
模型 IDclaude-sonnet-5在 API 和评测日志中固定精确 ID。
发布日期2026 年 6 月 30 日版本比较必须保持任务和测试环境一致。
输入 / 输出文本、图片输入;文本输出工具和多模态行为取决于入口。
上下文 / 最大输出100 万 token / 12.8 万 token目录上限,客户端有效限制可能更小。
思考自适应;目录列出的默认 effort 为 high应比较 effort 档位,而不只比较模型名。
API 价格快照每百万输入 2 美元 / 输出 10 美元订阅、云平台和 Tabbit 费用另算。
获取Anthropic 列出 Claude 套餐和 Claude API检查账户、地区、配额和实时选择器。

目录显示的可靠知识截止时间是 2026 年 1 月。这是目录元数据,不代表连接的工具或检索层保持最新。若要判断浏览器入口,智能体浏览器与普通聊天窗口的区别在于能否检查和操作实时网页;模型能力本身不会自动获得这些权限。

它比 Sonnet 4.6 变化了什么?

Anthropic 将升级重点放在智能体任务:更长的计划、浏览器和终端工具、编码、推理与知识工作。发布说明还称不良行为率低于 Sonnet 4.6,并默认启用网络安全防护。这些是厂商发布口径,应作为背景,而不是自己的任务结论。

维度Sonnet 4.6Sonnet 5对读者的行动
智能体跟进上一代 Sonnet 基线Anthropic 称可完成更多多步骤工作并检查结果用明确停止条件和验收命令测试。
工具调用能力取决于入口发布重点是浏览器和终端工具检查权限并记录每次工具调用。
终端工作Vellum/系统卡快照为 67.0%同一公开比较中 Terminal-Bench 2.1 为 80.4%这是公开评测,不是你的仓库重跑。
知识工作同一比较中的上一代基线GDPval-AA v2 为 1,618,Opus 4.8 为 1,6153 分差不能推出普遍胜负。
代码审查CodeRabbit 约 63% 严格召回、29% 精准度约 50–51% 严格召回、38–40% 精准度有意识地选择评论干净或覆盖更广。
安全Sonnet 4.6 基线Anthropic 称不良行为更少,默认开启网络安全防护安全流程仍需人工复核和专门测试。

Vellum 还提醒,Anthropic 修订过部分 Sonnet 4.6 基线。不能把不同日期、评分器或工具配置的数字拼成一个排行榜。Claude Sonnet 5 测评资源收集了来源笔记,智能体推理指南说明为什么基准评测只能代表长流程的一部分。

仍然未知的事情

第一,公开评测不等于你的测试环境。Endor Labs 的 Agent Security League 报告显示,Sonnet 5 搭配 Claude Code 在功能正确性上较强,但漏洞闭环明显更弱。报告摘要写 83.2% FuncPass,正文写 82.6%,因此本文不把任何一个数字当作确定的标题事实。能迁移的结论更窄:通过功能测试的补丁不等于安全补丁。

第二,effort 会改变单任务成本。CodeRabbit 发现更高 effort 没有明显改善严格缺陷召回,却大约使审查成本翻倍。每百万 token 的价格不是任务预算;比较时要记录思考 token、重试、工具调用和人工修正。

第三,入口决定可用性。Anthropic 列出 Claude 套餐和 API,但实时选择器、地区、配额和工具集决定用户实际能做什么。API 能用不代表浏览器客户端或第三方提供商开放相同模型。

社区正在争论什么

Reddit 讨论暴露了发布页无法单独解决的选择。Exodus_Green 阅读公开图表后认为,Sonnet 4.6 的 low effort 可能在智能体搜索中超过 Sonnet 5 的 medium,尽管价格略高(原评论)。这提醒我们比较 effort 档位。

反方向的 Rent_South 用自己的逻辑流程评测,每个模型运行五次,结论是模型选择取决于工作流(同帖)。qubedView 把成本边界说得更具体:单任务成本才重要,Sonnet 处理单次文档抽取可能便宜得多,而 Opus 更适合困难编码(原讨论)。TheRealJesus2 建议拆分任务,让小模型负责低或中等推理,让大模型规划和验证(同讨论)。

这些是个人报告,不是基准评测。9 月 20 日尝试了 X 搜索和 YouTube 搜索,但浏览器会话没有暴露稳定、可归属的帖子或评论正文。本文不放截图,并继续保持草稿。

谁适合尝试?

如果你的工作是这样第一步原因
重复抽取、分类或路由先用低/中 effort 试 Sonnet 5社区信号和成本逻辑都更支持边界清楚的任务。
有测试和验收条件的多文件编码开启工具,试运行 Sonnet 5发布定位和独立报告都指向更好的跟进能力。
高风险安全审查保留专用或更大模型功能正确不等于漏洞闭环,仍需人工签字。
单行修改或强低延迟聊天对照 Sonnet 4.6 或更快模型Sonnet 5 可能为小任务投入过多思考。
入口看不到 claude-sonnet-5不要承诺可用,先查账户和地区博客或目录中的模型名不是授权。

客户端也会改变任务形状。浏览器自动化不能消除模型限制、登录要求或复核职责。若团队比较的是产品而不是模型,可另看 AI 浏览器对比AI 浏览器指南

实际下一步:测量一个完成任务

选一个可回滚且有代表性的任务,例如从小型文档集中抽取字段,或带现有测试命令的多文件修改。记录:

  1. 精确模型 ID 和客户端;

  2. effort、上下文大小和工具权限;

  3. 输入、输出和思考 token;

  4. 耗时、重试和工具调用;

  5. 结果是否通过独立检查;

  6. 是否需要人工修复或收尾。

再用 Sonnet 4.6 或当前模型运行相同测试样本。只有 Sonnet 5 在每个完成结果上更便宜,而不是每个 token 更便宜,才值得切换。Tabbit Browser 说明介绍浏览器工作流,Tabbit 实践说明如何保留人工参与。

本稿没有在 Tabbit 中测试 Sonnet 5,因此不声称任何已登录账户当前都能看到它。如果你的选择器出现该模型,先运行一个可回滚的小任务。入口适合时再下载:

Tabbit Browser

结论

Claude Sonnet 5 值得在智能体编码、工具工作流和重复知识工作中进行受控试用。它的跟进能力和大上下文让它不只是 Sonnet 4.6 的小修订,但它不是自动替代 Opus 的答案,也不是安全保证或低成本保证。effort、重试、入口限制和任务拆分决定最终结果。

从满足验收条件所需的最低 effort 开始,记录每个完成任务的成本,只有在任务证明需要时才升级。真实 Tabbit 账户测试和所需社区截图完成前,本稿保持草稿。

来源

常见问题

Claude Sonnet 5 是什么?

Claude Sonnet 5 是 Anthropic 面向编码、工具调用、知识工作和智能体流程的中档模型。2026 年 9 月 20 日核对的 Claude Platform 目录列出 API ID claude-sonnet-5、自适应思考、100 万 token 上下文和 12.8 万 token 最大输出。

Claude Sonnet 5 比 Sonnet 4.6 变化了什么?

Anthropic 将 Sonnet 5 定位为更具智能体能力的版本,重点是推理、工具调用、编码和知识工作。独立报告也显示取舍:在特定代码审查测试环境中,评论更干净,但严格缺陷召回可能下降。

Claude Sonnet 5 的上下文和输出上限是多少?

2026 年 9 月 20 日核对的 Claude Platform 模型目录列出 100 万 token 上下文和 12.8 万 token 最大输出。这是模型目录上限,具体客户端、套餐或提供商可能暴露不同的有效限制。

Claude Sonnet 5 多少钱?

当前 Claude Platform 快照列出每百万输入 token 2 美元、每百万输出 token 10 美元。API、消费者订阅、云平台和第三方加价分别计算,自适应思考也会改变单任务成本。

在哪里可以使用 Claude Sonnet 5?

Anthropic 的发布说明列出 Claude 各套餐和 Claude API。具体模型选择器、地区、配额和工具取决于使用入口,向团队承诺可用前应检查实时账户或提供商页面。

切换前应该怎样测试 Claude Sonnet 5?

选择一个有代表性的任务,记录模型 ID、effort 档位、工具调用、耗时、总 token,以及是否需要人工接管,再与 Sonnet 4.6 或当前模型比较。一次成功不能证明生产可靠性。

下一步

让 Tabbit 与你并肩工作。

跨标签页调研、自动化重复的浏览器工作,让每一处上下文都触手可及。