Anthropic 的发布数据把 Sonnet 4.6 定位为较低成本的 Opus 级候选:SWE-bench、OSWorld、OfficeQA、金融 Agent 和长上下文表现强,但极深推理、复杂搜索和高难重构仍建议考虑 Opus 4.6。
模型:Claude Sonnet 4.6,API 入口 claude-sonnet-4-6;1M token context window 为 beta。
价格:发布页写明起价 $3/$15 每百万输入/输出 token,与 Sonnet 4.5 相同。
基准/工作流:SWE-bench Verified、OSWorld-Verified、Vending-Bench Arena、OfficeQA、Finance Agent v1.1、GDPval-AA、Claude Code 用户偏好;不同指标的 harness 不同。
版本边界:Anthropic 特别说明 Sonnet 4.5 之前用原 OSWorld,Sonnet 4.5 起用 OSWorld-Verified,不能直接跨版本横比。
发布页未公开所有 benchmark 的完整 prompt、采样参数、重复次数和逐题轨迹。Claude Code 用户偏好来自早期测试;Vending-Bench Arena 是模拟经营长期任务;OSWorld-Verified 使用模拟计算机、鼠标键盘和真实软件场景。
Claude Code 中用户约 70% 的时间偏好 Sonnet 4.6 胜过 Sonnet 4.5;相对 Opus 4.5 用户偏好约 59%。
Sonnet 4.6 在发布页引用的数据中与 Opus 4.6 匹配 OfficeQA;Anthropic 称其在 Vending-Bench Arena 先重投能力、后转向盈利并领先完成。
Anthropic 的客户/合作方反馈称,Box 在重推理问答中较 Sonnet 4.5 提升 15 个百分点;某保险 benchmark 达 94%,但这些案例没有统一公开完整方法。
发布页称 Sonnet 4.6 在计算机使用上较上一代明显提升,并在多标签表格和多步骤表单中接近人类级体验;同时承认仍落后于熟练人类。
Sonnet 4.6 适合把大量常规编码、浏览器/桌面自动化、企业文档和金融分析任务从 Opus 下放到更便宜的默认路由;对深层重构、多 Agent 协调、复杂 agentic search,应做 Sonnet/Opus 路由 eval。
官方自报,许多结果依赖 Anthropic 自有 scaffold、早期用户偏好或客户案例;未公开完整原始数据和方差。
79.6% SWE、72.5% OSWorld 等常见数字应以系统卡/发布页对应配置核对,不可把所有 benchmark 结果混为一张榜。
1M context 为 beta,且长上下文价格/平台限制可能不同。
电脑使用面对 prompt injection 等风险;发布页只说明安全评估改进,生产部署仍需隔离、权限和网页内容不可信处理。
固定 claude-sonnet-4-6 snapshot、effort、thinking、工具权限和上下文窗口配置。
对真实代码 issue、浏览器表单、企业 PDF/表格和金融分析建立同一任务集,保存所有工具轨迹。
分别跑 Sonnet 4.6 与 Opus 4.6,报告正确率、resolved、工具调用、延迟、token、成本和 prompt injection 失败。
将官方数字作为基线而不是复现结果,说明自己的 harness 与 Anthropic harness 的差异。
Claude Sonnet 4.6