Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Claude Sonnet 4.6

Claude Sonnet 4.6 官方发布:编码、电脑使用与 Agent 基准

原始来源

Anthropic News / Introducing Sonnet 4.6

作者Anthropic

原文日期2026-02-17

Tabbit 整理2026-08-19

查看原文

一句话结论

Anthropic 的发布数据把 Sonnet 4.6 定位为较低成本的 Opus 级候选:SWE-bench、OSWorld、OfficeQA、金融 Agent 和长上下文表现强,但极深推理、复杂搜索和高难重构仍建议考虑 Opus 4.6。

测试环境

  • 模型:Claude Sonnet 4.6,API 入口 claude-sonnet-4-6;1M token context window 为 beta。

  • 价格:发布页写明起价 $3/$15 每百万输入/输出 token,与 Sonnet 4.5 相同。

  • 基准/工作流:SWE-bench Verified、OSWorld-Verified、Vending-Bench Arena、OfficeQA、Finance Agent v1.1、GDPval-AA、Claude Code 用户偏好;不同指标的 harness 不同。

  • 版本边界:Anthropic 特别说明 Sonnet 4.5 之前用原 OSWorld,Sonnet 4.5 起用 OSWorld-Verified,不能直接跨版本横比。

输入/配置

发布页未公开所有 benchmark 的完整 prompt、采样参数、重复次数和逐题轨迹。Claude Code 用户偏好来自早期测试;Vending-Bench Arena 是模拟经营长期任务;OSWorld-Verified 使用模拟计算机、鼠标键盘和真实软件场景。

结果数据

  • Claude Code 中用户约 70% 的时间偏好 Sonnet 4.6 胜过 Sonnet 4.5;相对 Opus 4.5 用户偏好约 59%。

  • Sonnet 4.6 在发布页引用的数据中与 Opus 4.6 匹配 OfficeQA;Anthropic 称其在 Vending-Bench Arena 先重投能力、后转向盈利并领先完成。

  • Anthropic 的客户/合作方反馈称,Box 在重推理问答中较 Sonnet 4.5 提升 15 个百分点;某保险 benchmark 达 94%,但这些案例没有统一公开完整方法。

  • 发布页称 Sonnet 4.6 在计算机使用上较上一代明显提升,并在多标签表格和多步骤表单中接近人类级体验;同时承认仍落后于熟练人类。

结论

Sonnet 4.6 适合把大量常规编码、浏览器/桌面自动化、企业文档和金融分析任务从 Opus 下放到更便宜的默认路由;对深层重构、多 Agent 协调、复杂 agentic search,应做 Sonnet/Opus 路由 eval。

局限

  • 官方自报,许多结果依赖 Anthropic 自有 scaffold、早期用户偏好或客户案例;未公开完整原始数据和方差。

  • 79.6% SWE、72.5% OSWorld 等常见数字应以系统卡/发布页对应配置核对,不可把所有 benchmark 结果混为一张榜。

  • 1M context 为 beta,且长上下文价格/平台限制可能不同。

  • 电脑使用面对 prompt injection 等风险;发布页只说明安全评估改进,生产部署仍需隔离、权限和网页内容不可信处理。

复现步骤

  1. 固定 claude-sonnet-4-6 snapshot、effort、thinking、工具权限和上下文窗口配置。

  2. 对真实代码 issue、浏览器表单、企业 PDF/表格和金融分析建立同一任务集,保存所有工具轨迹。

  3. 分别跑 Sonnet 4.6 与 Opus 4.6,报告正确率、resolved、工具调用、延迟、token、成本和 prompt injection 失败。

  4. 将官方数字作为基线而不是复现结果,说明自己的 harness 与 Anthropic harness 的差异。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Sonnet 4.6

在 Tabbit 中使用并对比模型

Claude Sonnet 4.6

相关测评

媒体BenchLM2026-08-17

BenchLM 对 Claude Sonnet 4.6 的公开证据账本

媒体IDP Leaderboard2026-03

IDP Leaderboard:Sonnet 4.6 在真实文档理解上与 Opus 4.6 持平

媒体Artificial Analysis

Artificial Analysis:Sonnet 4.6 非推理 Intelligence Index 37

媒体Sansa Bench(trysansa.com)

Sansa Bench:Sonnet 4.6 高推理总体 0.733,当前排第 4

Claude Sonnet 4.6

相关提示词

媒体Claude Platform Docs / Prompting best practices

Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示

媒体Claude Platform Docs / Effort 与 Prompting best practices

Claude Sonnet 4.6 的 effort 与工具触发配置

媒体Anthropic Platform Docs / Computer Use API Reference2026-02-17

Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流

媒体Anthropic Platform Docs / Context Management & Compaction2026-02-17

Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置