Anthropic 的发布数据把 Sonnet 4.6 定位为较低成本的 Opus 级候选:SWE-bench、OSWorld、OfficeQA、金融 Agent 和长上下文表现强,但极深推理、复杂搜索和高难重构仍建议考虑 Opus 4.6。
Anthropic News / Introducing Sonnet 4.6 · 查看证据Claude Sonnet 4.6 · 测评与证据
Claude Sonnet 4.6,哪些结论值得看?
按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。
这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。
编辑结论
编辑结论
在标准 Ubuntu 桌面评测套件 OSWorld-Verified 中,Claude Sonnet 4.6 取得了 72.5% 的任务成功率,逼近旗舰 Opus 4.6(72.7%),但在高频复杂动态弹窗及多层级右键菜单场景下仍存在一定的视觉定位抖动。
OSWorld Benchmark Leaderboard / Evaluation Suite · 查看证据Artificial Analysis 把 Claude Sonnet 4.6(Non-reasoning, High Effort)放在同类非推理模型里 Intelligence Index 37、约 46 tok/s、输入 $3 / 输出 $15 / 百万 token,并标明 1M 上下文;页面同时提示该模型已 deprecated,智能分数不再代表最新 Sonnet。
Artificial Analysis · 查看证据完整测评与相关内容
精选证据
Claude Sonnet 4.6 官方发布:编码、电脑使用与 Agent 基准
Anthropic 的发布数据把 Sonnet 4.6 定位为较低成本的 Opus 级候选:SWE-bench、OSWorld、OfficeQA、金融 Agent 和长上下文表现强,但极深推理、复杂搜索和高难重构仍建议考虑 Opus 4.6。
待验证:本次未能重新核实原文。
- 模型/版本
- Claude-Sonnet-4.6;来源日期:2026-02-17。
- harness/任务
- 模型:Claude Sonnet 4.6,API 入口 `claude-sonnet-4-6`;1M token context window 为 beta。;价格:发布页写明起价 $3/$15 每百万输入/输出 token,与 Sonnet 4.5 相同。
- 样本/缺口
- 局限记录:1M context 为 beta,且长上下文价格/平台限制可能不同。;电脑使用面对 prompt injection 等风险;发布页只说明安全评估改进,生产部署仍需隔离、权限和网页内容不可信处理。
OSWorld-Verified 独立评测:Claude Sonnet 4.6 计算机操作与 GUI 任务深度分析
在标准 Ubuntu 桌面评测套件 OSWorld-Verified 中,Claude Sonnet 4.6 取得了 72.5% 的任务成功率,逼近旗舰 Opus 4.6(72.7%),但在高频复杂动态弹窗及多层级右键菜单场景下仍存在一定的视觉定位抖动。
待验证:本次未能重新核实原文。
- 模型/版本
- Claude-Sonnet-4.6;来源日期:2026-02-28。
- harness/任务
- 模型:Claude Sonnet 4.6(API 版本 `claude-sonnet-4-6`)。;价格:输入 $3.00 / 百万 token,输出 $15.00 / 百万 token。
- 样本/缺口
- 局限记录:失败模式集中:主要失败集中在:1) 页面微小像素级下拉箭头点击偏移(占比约 35% 的失败);2) 突发异步网络加载慢导致的动作抢跑;3) 软件快捷键冲突未触发。;高阶图形编辑较弱:在 GIMP 图像裁切、图层混合等连续空间判断任务中,成功率仅略超 50%。
Artificial Analysis:Sonnet 4.6 非推理 Intelligence Index 37
Artificial Analysis 把 Claude Sonnet 4.6(Non-reasoning, High Effort)放在同类非推理模型里 Intelligence Index 37、约 46 tok/s、输入 $3 / 输出 $15 / 百万 token,并标明 1M 上下文;页面同时提示该模型已 deprecated,智能分数不再代表最新 Sonnet。
待验证:本次未能重新核实原文。
- 模型/版本
- Claude-Sonnet-4.6;来源日期:2026-08-20。
- harness/任务
- 展示配置:Claude Sonnet 4.6,Non-reasoning,Effort high。;指数版本:Artificial Analysis Intelligence Index v4.1.1,含 GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。
- 样本/缺口
- 局限记录:Cost per task 与 verbosity 为 N/A,不能从本页推断单位任务美元。;Intelligence Index 是 9 项合成,不能还原成 SWE 或 OSWorld。
Reddit:Sonnet 4.6 medium effort 能做日常工作,复杂项目仍要 Opus 规划
发帖人认为 Claude Code 里 Sonnet 4.6 medium effort 已能完成大量日常和高强度任务;评论共识则是:简单执行可以留在 Sonnet,复杂推理、规划和高压编码仍要用 Opus 先做架构,再交给 Sonnet 落地。
待验证:本次未能重新核实原文。
- 模型/版本
- Claude-Sonnet-4.6;来源日期:2026-06。
- harness/任务
- 产品:Claude Code(帖子 flair: Question about Claude Code)。;配置:发帖人明确只用 Sonnet,且不超过 medium effort。
- 样本/缺口
- 局限记录:发帖人自认不是最高强度用户,却又说“用得比大多数人深”,两端都无法验证。;BrowseComp 读图来自另一帖评论,缺少原图与官方表,不得升格为独立测评结论。
全部来源
全部来源
Claude Sonnet 4.6 官方发布:编码、电脑使用与 Agent 基准
Anthropic 的发布数据把 Sonnet 4.6 定位为较低成本的 Opus 级候选:SWE-bench、OSWorld、OfficeQA、金融 Agent 和长上下文表现强,但极深推理、复杂搜索和高难重构仍建议考虑 Opus 4.6。
待验证:本次未能重新核实原文。
- 模型/版本
- Claude-Sonnet-4.6;来源日期:2026-02-17。
- harness/任务
- 模型:Claude Sonnet 4.6,API 入口 `claude-sonnet-4-6`;1M token context window 为 beta。;价格:发布页写明起价 $3/$15 每百万输入/输出 token,与 Sonnet 4.5 相同。
- 样本/缺口
- 局限记录:1M context 为 beta,且长上下文价格/平台限制可能不同。;电脑使用面对 prompt injection 等风险;发布页只说明安全评估改进,生产部署仍需隔离、权限和网页内容不可信处理。
OSWorld-Verified 独立评测:Claude Sonnet 4.6 计算机操作与 GUI 任务深度分析
在标准 Ubuntu 桌面评测套件 OSWorld-Verified 中,Claude Sonnet 4.6 取得了 72.5% 的任务成功率,逼近旗舰 Opus 4.6(72.7%),但在高频复杂动态弹窗及多层级右键菜单场景下仍存在一定的视觉定位抖动。
待验证:本次未能重新核实原文。
- 模型/版本
- Claude-Sonnet-4.6;来源日期:2026-02-28。
- harness/任务
- 模型:Claude Sonnet 4.6(API 版本 `claude-sonnet-4-6`)。;价格:输入 $3.00 / 百万 token,输出 $15.00 / 百万 token。
- 样本/缺口
- 局限记录:失败模式集中:主要失败集中在:1) 页面微小像素级下拉箭头点击偏移(占比约 35% 的失败);2) 突发异步网络加载慢导致的动作抢跑;3) 软件快捷键冲突未触发。;高阶图形编辑较弱:在 GIMP 图像裁切、图层混合等连续空间判断任务中,成功率仅略超 50%。
Artificial Analysis:Sonnet 4.6 非推理 Intelligence Index 37
Artificial Analysis 把 Claude Sonnet 4.6(Non-reasoning, High Effort)放在同类非推理模型里 Intelligence Index 37、约 46 tok/s、输入 $3 / 输出 $15 / 百万 token,并标明 1M 上下文;页面同时提示该模型已 deprecated,智能分数不再代表最新 Sonnet。
待验证:本次未能重新核实原文。
- 模型/版本
- Claude-Sonnet-4.6;来源日期:2026-08-20。
- harness/任务
- 展示配置:Claude Sonnet 4.6,Non-reasoning,Effort high。;指数版本:Artificial Analysis Intelligence Index v4.1.1,含 GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。
- 样本/缺口
- 局限记录:Cost per task 与 verbosity 为 N/A,不能从本页推断单位任务美元。;Intelligence Index 是 9 项合成,不能还原成 SWE 或 OSWorld。
Reddit:Sonnet 4.6 medium effort 能做日常工作,复杂项目仍要 Opus 规划
发帖人认为 Claude Code 里 Sonnet 4.6 medium effort 已能完成大量日常和高强度任务;评论共识则是:简单执行可以留在 Sonnet,复杂推理、规划和高压编码仍要用 Opus 先做架构,再交给 Sonnet 落地。
待验证:本次未能重新核实原文。
- 模型/版本
- Claude-Sonnet-4.6;来源日期:2026-06。
- harness/任务
- 产品:Claude Code(帖子 flair: Question about Claude Code)。;配置:发帖人明确只用 Sonnet,且不超过 medium effort。
- 样本/缺口
- 局限记录:发帖人自认不是最高强度用户,却又说“用得比大多数人深”,两端都无法验证。;BrowseComp 读图来自另一帖评论,缺少原图与官方表,不得升格为独立测评结论。
BenchLM 对 Claude Sonnet 4.6 的公开证据账本
BenchLM 的可展示来源账本给 Sonnet 4.6 记录 22 行 benchmark:SWE-bench Verified 79.6%、OSWorld-Verified 72.1%、Terminal-Bench 59.1%、GPQA 89.9%,同时显示不同类别强弱差异,适合做复核入口而非单一总分。
待验证:本次未能重新核实原文。
- 模型/版本
- Claude-Sonnet-4.6;来源日期:2026-08-17。
- harness/任务
- 数据时间:2026-08-17;页面称有 22 条可展示来源的 benchmark row。;聚合:页面把 Coding、Agentic、Knowledge、Math、Multimodal 等类别分别加权;总分 64.53/100,排名 39/218,但该总分是 BenchLM 自定义聚合。
- 样本/缺口
- 局限记录:页面当前目录包含未来模型与动态榜单,结果会变化;需记录采集日期和链接状态。;某些行的模型版本、effort、工具和评测重复次数不完整,不能无条件宣称“可完全复现”。
Reddit MLOps 对 Claude Sonnet 4.6 与 Opus 4.6 的任务分层观察
社区将 Sonnet 4.6 的强项归为办公、金融、电脑使用和常规编码,将 Opus 4.6 的优势归为深层推理、终端编码和 agentic search;但帖子也明确提醒这些是 Anthropic 自报 scaffold 的静态 benchmark。
待验证:本次未能重新核实原文。
- 模型/版本
- Claude-Sonnet-4.6;来源日期:2026-02-17。
- harness/任务
- 环境:Reddit 用户整理 Anthropic 公告、VentureBeat、TechCrunch、OfficeChai 等资料。;输入/配置:帖子列出 Sonnet 4.6/Opus 4.6 的多项发布数字,未提供独立运行输入、重复次数或完整工具轨迹。
- 样本/缺口
- 局限记录:帖子中的个别数字与不同页面/版本可能有差异,不能当作实时排行榜。;没有统一 scaffold、样本、重复次数和成本统计;不能推导绝对成功率。
IDP Leaderboard:Sonnet 4.6 在真实文档理解上与 Opus 4.6 持平
在开放文档 AI 排行榜上,Claude Sonnet 4.6 总分 80.7,略高于 Opus 4.6 的 80.4,适合把 OCR、表格、版式和关键信息抽取从 Opus 下放到 Sonnet;归档扫描件仍要防内容审核误拦。
待验证:本次未能重新核实原文。
- 模型/版本
- Claude-Sonnet-4.6;来源日期:2026-03。
- harness/任务
- 模型:排行榜第 8 名 Claude Sonnet 4.6,第 9 名 Claude Opus 4.6,第 16 名 Claude Haiku 4.5。;任务:Intelligent Document Processing,覆盖 OCR、表格抽取、关键信息抽取、视觉问答;总分是各基准分的均值。
- 样本/缺口
- 局限记录:首页未公开 Claude 的完整采样配置;成本数字来自 Reddit 同步帖,不是排行榜主表字段。;内容审核失败会计入相关分项,不等于模型“看不懂”该页。
CursorBench:Sonnet 4.6 得 49%,作为 Sonnet 5 上线对照基线
Cursor 官方在 CursorBench 上把新上线的 Claude Sonnet 5 写成 57%,把 Claude Sonnet 4.6 写成 49%;这说明 4.6 仍是 Cursor 内部编码代理评测的对照基线,但公开帖没有给出题目、配置和逐题轨迹。
待验证:本次未能重新核实原文。
- 模型/版本
- Claude-Sonnet-4.6;来源日期:2026-07-01。
- harness/任务
- 任务:CursorBench(Cursor 自有编码/代理评测,帖文未展开定义)。;对照模型:Claude Sonnet 5 vs Claude Sonnet 4.6。
- 样本/缺口
- 局限记录:厂商在发布新产品时给出的对照,存在选择基准的偏差。;未说明 4.6 / 5 是否使用相同 effort、上下文窗口和工具集。
Browser Use BU Benchmark:Sonnet 4.6 浏览器代理 62%
Browser Use 在自有 BU Benchmark 上给 Claude Sonnet 4.6 记 62%,低于 Gemini 3.6 Flash 的 68%、GPT-5.6-sol 的 67% 和 Opus 4.8 的 74%;它说明 4.6 能做浏览器代理,但不是该 harness 上性价比最高的选择。
待验证:本次未能重新核实原文。
- 模型/版本
- Claude-Sonnet-4.6;来源日期:2026-07-22。
- harness/任务
- 任务:BU Benchmark,Browser Use 用于评估浏览器/网页代理。;对照模型:Gemini 3.6 Flash 68%;GPT-5.6-sol 67%;Claude Sonnet 4.6 62%;Claude Opus 4.8 74%。
- 样本/缺口
- 局限记录:未说明 Sonnet 4.6 的 API 参数、是否 computer-use beta、截图分辨率。;不能与 Anthropic 官方 OSWorld-Verified 72.5% 混成一张榜。
Harvey Legal Agent Bench:Sonnet 4.6 全通过率 4.2%
Harvey 在法律代理基准 LAB 上给 Claude Sonnet 4.6 记全通过率 4.2%,低于 Opus 4.6 的 6.6%;同一榜上,后训练后的 NVIDIA Nemotron 3 Ultra 达到 5.8%,并声称运行成本是 Sonnet/Opus 的 1/8 到 1/50。
待验证:本次未能重新核实原文。
- 模型/版本
- Claude-Sonnet-4.6;来源日期:2026-06-11。
- harness/任务
- 基准:Harvey Legal Agent Bench(LAB)。;指标:full-pass / 全通过率。
- 样本/缺口
- 局限记录:成本 1/8–1/50 是作者对 Nemotron vs Claude 单价的陈述,不是 LAB 分数。;不能把 LAB 与 IDP 文档抽取或 SWE 编码混为一谈。
Sansa Bench:Sonnet 4.6 高推理总体 0.733,当前排第 4
Sansa Bench 当前总榜把 Claude-Sonnet-4.6 Reasoning High 记为 0.733,并列/紧随 Gemini-3.1-Pro-Preview Reasoning Low,低于 Opus 5 / 4.8 高推理;它适合看“开推理后的综合能力”,不适合直接引用 6 个月前 Reddit 帖里的旧分数。
待验证:本次未能重新核实原文。
- 模型/版本
- Claude-Sonnet-4.6;来源日期:2026-08-20。
- harness/任务
- 规模:页面写 103 models tested,Updated Aug 19, 2026。;总体分:各 capability 等权平均;评分含 exact match、numeric match、code execution、LLM judges。
- 样本/缺口
- 局限记录:Reddit 旧帖的 0.921 幻觉抗性等分项,在 2026-08-20 的总榜首屏未复现,不能当作当前官方数字。;LLM judge 会引入评判模型偏差。