Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Claude Sonnet 4.6 · 社区来源 · 编辑分析

Browser Use BU Benchmark:Sonnet 4.6 浏览器代理 62%

Browser Use 在自有 BU Benchmark 上给 Claude Sonnet 4.6 记 62%,低于 Gemini 3.6 Flash 的 68%、GPT-5.6-sol 的 67% 和 Opus 4.8 的 74%;它说明 4.6 能做浏览器代理,但不是该 harness 上性价比最高的选择。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

社区来源编辑分析编辑日期 2026-09-20

测试条件速查

模型/版本
Claude-Sonnet-4.6;来源日期:2026-07-22。
harness/任务
任务:BU Benchmark,Browser Use 用于评估浏览器/网页代理。;对照模型:Gemini 3.6 Flash 68%;GPT-5.6-sol 67%;Claude Sonnet 4.6 62%;Claude Opus 4.8 74%。
样本/缺口
局限记录:未说明 Sonnet 4.6 的 API 参数、是否 computer-use beta、截图分辨率。;不能与 Anthropic 官方 OSWorld-Verified 72.5% 混成一张榜。

关键数据与适用场景

一句话结论

Browser Use 在自有 BU Benchmark 上给 Claude Sonnet 4.6 记 62%,低于 Gemini 3.6 Flash 的 68%、GPT-5.6-sol 的 67% 和 Opus 4.8 的 74%;它说明 4.6 能做浏览器代理,但不是该 harness 上性价比最高的选择。

测试环境

  • 任务:BU Benchmark,Browser Use 用于评估浏览器/网页代理。

  • 对照模型:Gemini 3.6 Flash 68%;GPT-5.6-sol 67%;Claude Sonnet 4.6 62%;Claude Opus 4.8 74%。

  • 发布语境:配合 Google DeepMind 发布 Gemini 3.6 Flash,强调 Flash 价格下的网页代理质量。

  • 成本:帖文称 Gemini 3.6 Flash 成本远低于 Opus 4.8;未给出 Sonnet 4.6 的逐任务美元数。

输入/配置

X 帖未公开任务列表、浏览器环境、步数上限、是否截图、Sonnet 是否启用 computer-use 工具,以及 effort/thinking。分数只在 Browser Use 的 harness 内可比。

结果数据

模型BU Benchmark
Claude Opus 4.874%
Gemini 3.6 Flash68%
GPT-5.6-sol67%
Claude Sonnet 4.662%

作者把 Gemini 3.6 Flash 称作其测试过的浏览器代理里性价比最高的模型,并写它仅次于 Opus 4.8。

结论

需要网页代理时,Sonnet 4.6 是可用的中档选择,但在 Browser Use 的公开对照里既不是最准也不是最便宜。若目标是纯浏览器自动化,应把 Gemini 3.6 Flash 和 GPT-5.6-sol 放进同一 harness 再决定;若目标是桌面+浏览器混合 computer use,这条 BU 分数不能替代 OSWorld。

局限

  • 只有四个百分数,没有逐任务日志。

  • 厂商在发布竞品对照时强调 Flash,Sonnet 4.6 是被比较的基线而非被优化对象。

  • 未说明 Sonnet 4.6 的 API 参数、是否 computer-use beta、截图分辨率。

  • 不能与 Anthropic 官方 OSWorld-Verified 72.5% 混成一张榜。

复现步骤

  1. 固定同一浏览器代理脚手架(或 Browser Use 公开 benchmark),分别接入 claude-sonnet-4-6、Gemini 3.6 Flash、GPT-5.6-sol。

  2. 记录成功率、步数、token、美元成本和卡住的页面类型(登录墙、动态 DOM、多标签表单)。

  3. 单独统计 prompt injection / 误点支付等安全失败。

  4. 不要把 BU% 与 OSWorld% 相加减。

能支持的判断

  • 需要网页代理时,Sonnet 4.6 是可用的中档选择,但在 Browser Use 的公开对照里既不是最准也不是最便宜。若目标是纯浏览器自动化,应把 Gemini 3.6 Flash 和 GPT-5.6-sol 放进同一 harness 再决定;若目标是桌面+浏览器混合 computer use,这条 BU 分数不能替代 OSWorld。

不能支持的判断

  • 未说明 Sonnet 4.6 的 API 参数、是否 computer-use beta、截图分辨率。
  • 不能与 Anthropic 官方 OSWorld-Verified 72.5% 混成一张榜。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

X · Browser Use(@browseruse) · 原文发布日期 2026-07-22 · 本站编辑日期 2026-09-20

打开原始来源

Claude Sonnet 4.6

在 Tabbit 中比较 Claude Sonnet 4.6

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Claude Sonnet 4.6 是什么:价格、获取方式与 Sonnet 5 迁移问题

用来源说明 Claude Sonnet 4.6 的 1M 上下文、$3/$15 API 价格、Active legacy 状态、访问入口和迁移取舍。

相关评测

Claude Sonnet 4.6 官方发布:编码、电脑使用与 Agent 基准Anthropic 的发布数据把 Sonnet 4.6 定位为较低成本的 Opus 级候选:SWE-bench、OSWorld、OfficeQA、金融 Agent 和长上下文表现强,但极深推理、复杂搜索和高难重构仍建议考虑 Opus 4.6。OSWorld-Verified 独立评测:Claude Sonnet 4.6 计算机操作与 GUI 任务深度分析在标准 Ubuntu 桌面评测套件 OSWorld-Verified 中,Claude Sonnet 4.6 取得了 72.5% 的任务成功率,逼近旗舰 Opus 4.6(72.7%),但在高频复杂动态弹窗及多层级右键菜单场景下仍存在一定的视觉定位抖动。Reddit:Sonnet 4.6 medium effort 能做日常工作,复杂项目仍要 Opus 规划发帖人认为 Claude Code 里 Sonnet 4.6 medium effort 已能完成大量日常和高强度任务;评论共识则是:简单执行可以留在 Sonnet,复杂推理、规划和高压编码仍要用 Opus 先做架构,再交给 Sonnet 落地。Artificial Analysis:Sonnet 4.6 非推理 Intelligence Index 37Artificial Analysis 把 Claude Sonnet 4.6(Non-reasoning, High Effort)放在同类非推理模型里 Intelligence Index 37、约 46 tok/s、输入 $3 / 输出 $15 / 百万 token,并标明 1M 上下文;页面同时提示该模型已 deprecated,智能分数不再代表最新 Sonnet。Claude Code 下 Sonnet 4.6 的多智能体协作与工程开发工作流按“Claude Code 下 Sonnet 4.6 的多智能体协作与工程开发工作流”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示按“Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流按“Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置按“Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。