模型:Claude Sonnet 5,与 Sonnet 4.6、Opus 4.8 对比。
评测:官方展示 BrowseComp(Agentic Search)与 OSWorld-Verified(computer use),并在系统卡中报告更多能力与安全评估。
推理控制:effort 档位;官方图表比较不同 effort 下的成本-性能。
价格:输入 $2 / 百万 token,输出 $10 / 百万 token;官方称该引入价在 8 月 10 日改为永久价格。
API 模型名:claude-sonnet-5。
可用范围:Claude Free/Pro 默认模型,Max、Team、Enterprise 可用,也可经 Claude API 调用。
Agent 评测使用工具调用、长任务和不同 effort 档位;完整数值应以官方图表和 System Card 为准。
官方结论是 Sonnet 5 在 agentic reasoning、工具使用、编码和知识工作上明显优于 Sonnet 4.6,部分高 effort 任务可接近 Opus 4.8。
在 BrowseComp 与 OSWorld-Verified 的官方成本-性能图中,Sonnet 5 提供比 Opus 4.8 更宽的成本选择;官方特别强调 medium effort 的成本效率。
官方安全评估称 Sonnet 5 的不良行为、幻觉、谄媚和提示注入劫持率总体低于 Sonnet 4.6。
网络安全边界:在 Firefox 漏洞利用评估中,Sonnet 5 与 Sonnet 4.6 都没有完成可工作的 exploit(均为 0%),Sonnet 5 的部分成功率略高;因此发布时启用了网络安全护栏。
官方定位是“更 Agent 化的 Sonnet”:适合多步编码、工具调用、浏览器/终端型工作流,并以 effort 档位换取成本与完成率的选择空间。官方同时明确其危险网络能力低于 Opus 级模型,但不能因此省略安全护栏。
官方材料是厂商自测和合作伙伴反馈,不是独立复现实验;BrowseComp、OSWorld 等具体配置与完整分数应以 System Card 为准。
“接近 Opus 4.8”取决于任务、effort 与预算,不能泛化为所有文本或代码任务的等价。
价格和默认行为可能仍随 API 产品变更;采集时以页面 2026-08-10 更新为准。
使用同一任务集,分别调用 Sonnet 5 的 medium、high、xhigh effort。
固定工具定义、超时、最大总 token 和重试规则,记录成功率、工具调用、输入/输出 token 与墙钟时间。
用 Sonnet 4.6 与 Opus 4.8 在同一 harness 重跑,不混用不同系统提示词或不同工具权限。
对代码/网络安全任务单独保留护栏、授权和人工复核记录,不以“未完成 exploit”推导为无风险。
官方 API 价格:输入 $2/M,输出 $10/M;官方页面说明该价格在 8 月 10 日由引入价改为永久价格。
官方将 Sonnet 5 描述为在复杂多步任务中更能持续执行、自检和完成交付。
官方安全评估同时报告了更低的整体不良行为率与仍需启用网络安全护栏的边界。
官方定位短句:“Our most agentic Sonnet yet”。
官方发布页把 effort 视为成本/性能调节杆,而不是单一固定能力等级。
Claude Sonnet 5