Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Claude Sonnet 4.6 · 媒体来源 · 厂商自报

Claude Sonnet 4.6 官方发布:编码、电脑使用与 Agent 基准

Anthropic 的发布数据把 Sonnet 4.6 定位为较低成本的 Opus 级候选:SWE-bench、OSWorld、OfficeQA、金融 Agent 和长上下文表现强,但极深推理、复杂搜索和高难重构仍建议考虑 Opus 4.6。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源厂商自报编辑日期 2026-09-20

测试条件速查

模型/版本
Claude-Sonnet-4.6;来源日期:2026-02-17。
harness/任务
模型:Claude Sonnet 4.6,API 入口 `claude-sonnet-4-6`;1M token context window 为 beta。;价格:发布页写明起价 $3/$15 每百万输入/输出 token,与 Sonnet 4.5 相同。
样本/缺口
局限记录:1M context 为 beta,且长上下文价格/平台限制可能不同。;电脑使用面对 prompt injection 等风险;发布页只说明安全评估改进,生产部署仍需隔离、权限和网页内容不可信处理。

关键数据与适用场景

一句话结论

Anthropic 的发布数据把 Sonnet 4.6 定位为较低成本的 Opus 级候选:SWE-bench、OSWorld、OfficeQA、金融 Agent 和长上下文表现强,但极深推理、复杂搜索和高难重构仍建议考虑 Opus 4.6。

测试环境

  • 模型:Claude Sonnet 4.6,API 入口 claude-sonnet-4-6;1M token context window 为 beta。

  • 价格:发布页写明起价 $3/$15 每百万输入/输出 token,与 Sonnet 4.5 相同。

  • 基准/工作流:SWE-bench Verified、OSWorld-Verified、Vending-Bench Arena、OfficeQA、Finance Agent v1.1、GDPval-AA、Claude Code 用户偏好;不同指标的 harness 不同。

  • 版本边界:Anthropic 特别说明 Sonnet 4.5 之前用原 OSWorld,Sonnet 4.5 起用 OSWorld-Verified,不能直接跨版本横比。

输入/配置

发布页未公开所有 benchmark 的完整 prompt、采样参数、重复次数和逐题轨迹。Claude Code 用户偏好来自早期测试;Vending-Bench Arena 是模拟经营长期任务;OSWorld-Verified 使用模拟计算机、鼠标键盘和真实软件场景。

结果数据

  • Claude Code 中用户约 70% 的时间偏好 Sonnet 4.6 胜过 Sonnet 4.5;相对 Opus 4.5 用户偏好约 59%。

  • Sonnet 4.6 在发布页引用的数据中与 Opus 4.6 匹配 OfficeQA;Anthropic 称其在 Vending-Bench Arena 先重投能力、后转向盈利并领先完成。

  • Anthropic 的客户/合作方反馈称,Box 在重推理问答中较 Sonnet 4.5 提升 15 个百分点;某保险 benchmark 达 94%,但这些案例没有统一公开完整方法。

  • 发布页称 Sonnet 4.6 在计算机使用上较上一代明显提升,并在多标签表格和多步骤表单中接近人类级体验;同时承认仍落后于熟练人类。

结论

Sonnet 4.6 适合把大量常规编码、浏览器/桌面自动化、企业文档和金融分析任务从 Opus 下放到更便宜的默认路由;对深层重构、多 Agent 协调、复杂 agentic search,应做 Sonnet/Opus 路由 eval。

局限

  • 官方自报,许多结果依赖 Anthropic 自有 scaffold、早期用户偏好或客户案例;未公开完整原始数据和方差。

  • 79.6% SWE、72.5% OSWorld 等常见数字应以系统卡/发布页对应配置核对,不可把所有 benchmark 结果混为一张榜。

  • 1M context 为 beta,且长上下文价格/平台限制可能不同。

  • 电脑使用面对 prompt injection 等风险;发布页只说明安全评估改进,生产部署仍需隔离、权限和网页内容不可信处理。

复现步骤

  1. 固定 claude-sonnet-4-6 snapshot、effort、thinking、工具权限和上下文窗口配置。

  2. 对真实代码 issue、浏览器表单、企业 PDF/表格和金融分析建立同一任务集,保存所有工具轨迹。

  3. 分别跑 Sonnet 4.6 与 Opus 4.6,报告正确率、resolved、工具调用、延迟、token、成本和 prompt injection 失败。

  4. 将官方数字作为基线而不是复现结果,说明自己的 harness 与 Anthropic harness 的差异。

能支持的判断

  • Sonnet 4.6 适合把大量常规编码、浏览器/桌面自动化、企业文档和金融分析任务从 Opus 下放到更便宜的默认路由;对深层重构、多 Agent 协调、复杂 agentic search,应做 Sonnet/Opus 路由 eval。

不能支持的判断

  • 1M context 为 beta,且长上下文价格/平台限制可能不同。
  • 电脑使用面对 prompt injection 等风险;发布页只说明安全评估改进,生产部署仍需隔离、权限和网页内容不可信处理。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Anthropic News / Introducing Sonnet 4.6 · Anthropic · 原文发布日期 2026-02-17 · 本站编辑日期 2026-09-20

打开原始来源

Claude Sonnet 4.6

在 Tabbit 中比较 Claude Sonnet 4.6

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Claude Sonnet 4.6 是什么:价格、获取方式与 Sonnet 5 迁移问题

用来源说明 Claude Sonnet 4.6 的 1M 上下文、$3/$15 API 价格、Active legacy 状态、访问入口和迁移取舍。

相关评测

Browser Use BU Benchmark:Sonnet 4.6 浏览器代理 62%Browser Use 在自有 BU Benchmark 上给 Claude Sonnet 4.6 记 62%,低于 Gemini 3.6 Flash 的 68%、GPT-5.6-sol 的 67% 和 Opus 4.8 的 74%;它说明 4.6 能做浏览器代理,但不是该 harness 上性价比最高的选择。Harvey Legal Agent Bench:Sonnet 4.6 全通过率 4.2%Harvey 在法律代理基准 LAB 上给 Claude Sonnet 4.6 记全通过率 4.2%,低于 Opus 4.6 的 6.6%;同一榜上,后训练后的 NVIDIA Nemotron 3 Ultra 达到 5.8%,并声称运行成本是 Sonnet/Opus 的 1/8 到 1/50。Artificial Analysis:Sonnet 4.6 非推理 Intelligence Index 37Artificial Analysis 把 Claude Sonnet 4.6(Non-reasoning, High Effort)放在同类非推理模型里 Intelligence Index 37、约 46 tok/s、输入 $3 / 输出 $15 / 百万 token,并标明 1M 上下文;页面同时提示该模型已 deprecated,智能分数不再代表最新 Sonnet。OSWorld-Verified 独立评测:Claude Sonnet 4.6 计算机操作与 GUI 任务深度分析在标准 Ubuntu 桌面评测套件 OSWorld-Verified 中,Claude Sonnet 4.6 取得了 72.5% 的任务成功率,逼近旗舰 Opus 4.6(72.7%),但在高频复杂动态弹窗及多层级右键菜单场景下仍存在一定的视觉定位抖动。Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示按“Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流按“Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置按“Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Code 下 Sonnet 4.6 的多智能体协作与工程开发工作流按“Claude Code 下 Sonnet 4.6 的多智能体协作与工程开发工作流”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。