Claude Sonnet 4.6 模型测评导航
汇总 Claude Sonnet 4.6 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。
媒体
5 条已核对来源的资料Claude Sonnet 4.6 官方发布:编码、电脑使用与 Agent 基准
Anthropic 的发布数据把 Sonnet 4.6 定位为较低成本的 Opus 级候选:SWE-bench、OSWorld、OfficeQA、金融 Agent 和长上下文表现强,但极深推理、复杂搜索和高难重构仍建议考虑 Opus 4.6。
BenchLM 对 Claude Sonnet 4.6 的公开证据账本
BenchLM 的可展示来源账本给 Sonnet 4.6 记录 22 行 benchmark:SWE-bench Verified 79.6%、OSWorld-Verified 72.1%、Terminal-Bench 59.1%、GPQA 89.9%,同时显示不同类别强弱差异,适合做复核入口而非单一总分。
IDP Leaderboard:Sonnet 4.6 在真实文档理解上与 Opus 4.6 持平
在开放文档 AI 排行榜上,Claude Sonnet 4.6 总分 80.7,略高于 Opus 4.6 的 80.4,适合把 OCR、表格、版式和关键信息抽取从 Opus 下放到 Sonnet;归档扫描件仍要防内容审核误拦。
Artificial Analysis:Sonnet 4.6 非推理 Intelligence Index 37
Artificial Analysis 把 Claude Sonnet 4.6(Non-reasoning, High Effort)放在同类非推理模型里 Intelligence Index 37、约 46 tok/s、输入 $3 / 输出 $15 / 百万 token,并标明 1M 上下文;页面同时提示该模型已 deprecated,智能分数不再代表最新 Sonnet。
Sansa Bench:Sonnet 4.6 高推理总体 0.733,当前排第 4
Sansa Bench 当前总榜把 Claude-Sonnet-4.6 Reasoning High 记为 0.733,并列/紧随 Gemini-3.1-Pro-Preview Reasoning Low,低于 Opus 5 / 4.8 高推理;它适合看“开推理后的综合能力”,不适合直接引用 6 个月前 Reddit 帖里的旧分数。
社区
6 条已核对来源的资料Reddit MLOps 对 Claude Sonnet 4.6 与 Opus 4.6 的任务分层观察
社区将 Sonnet 4.6 的强项归为办公、金融、电脑使用和常规编码,将 Opus 4.6 的优势归为深层推理、终端编码和 agentic search;但帖子也明确提醒这些是 Anthropic 自报 scaffold 的静态 benchmark。
OSWorld-Verified 独立评测:Claude Sonnet 4.6 计算机操作与 GUI 任务深度分析
在标准 Ubuntu 桌面评测套件 OSWorld-Verified 中,Claude Sonnet 4.6 取得了 72.5% 的任务成功率,逼近旗舰 Opus 4.6(72.7%),但在高频复杂动态弹窗及多层级右键菜单场景下仍存在一定的视觉定位抖动。
CursorBench:Sonnet 4.6 得 49%,作为 Sonnet 5 上线对照基线
Cursor 官方在 CursorBench 上把新上线的 Claude Sonnet 5 写成 57%,把 Claude Sonnet 4.6 写成 49%;这说明 4.6 仍是 Cursor 内部编码代理评测的对照基线,但公开帖没有给出题目、配置和逐题轨迹。
Browser Use BU Benchmark:Sonnet 4.6 浏览器代理 62%
Browser Use 在自有 BU Benchmark 上给 Claude Sonnet 4.6 记 62%,低于 Gemini 3.6 Flash 的 68%、GPT-5.6-sol 的 67% 和 Opus 4.8 的 74%;它说明 4.6 能做浏览器代理,但不是该 harness 上性价比最高的选择。
Harvey Legal Agent Bench:Sonnet 4.6 全通过率 4.2%
Harvey 在法律代理基准 LAB 上给 Claude Sonnet 4.6 记全通过率 4.2%,低于 Opus 4.6 的 6.6%;同一榜上,后训练后的 NVIDIA Nemotron 3 Ultra 达到 5.8%,并声称运行成本是 Sonnet/Opus 的 1/8 到 1/50。
Reddit:Sonnet 4.6 medium effort 能做日常工作,复杂项目仍要 Opus 规划
发帖人认为 Claude Code 里 Sonnet 4.6 medium effort 已能完成大量日常和高强度任务;评论共识则是:简单执行可以留在 Sonnet,复杂推理、规划和高压编码仍要用 Opus 先做架构,再交给 Sonnet 落地。
Claude Sonnet 4.6
在 Tabbit 中使用并对比模型
汇总 Claude Sonnet 4.6 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。