Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
社区Claude Sonnet 4.6

Browser Use BU Benchmark:Sonnet 4.6 浏览器代理 62%

原始来源

X

作者Browser Use(@browseruse)

原文日期2026-07-22

Tabbit 整理2026-08-20

查看原文

一句话结论

Browser Use 在自有 BU Benchmark 上给 Claude Sonnet 4.6 记 62%,低于 Gemini 3.6 Flash 的 68%、GPT-5.6-sol 的 67% 和 Opus 4.8 的 74%;它说明 4.6 能做浏览器代理,但不是该 harness 上性价比最高的选择。

测试环境

  • 任务:BU Benchmark,Browser Use 用于评估浏览器/网页代理。

  • 对照模型:Gemini 3.6 Flash 68%;GPT-5.6-sol 67%;Claude Sonnet 4.6 62%;Claude Opus 4.8 74%。

  • 发布语境:配合 Google DeepMind 发布 Gemini 3.6 Flash,强调 Flash 价格下的网页代理质量。

  • 成本:帖文称 Gemini 3.6 Flash 成本远低于 Opus 4.8;未给出 Sonnet 4.6 的逐任务美元数。

输入/配置

X 帖未公开任务列表、浏览器环境、步数上限、是否截图、Sonnet 是否启用 computer-use 工具,以及 effort/thinking。分数只在 Browser Use 的 harness 内可比。

结果数据

模型BU Benchmark
Claude Opus 4.874%
Gemini 3.6 Flash68%
GPT-5.6-sol67%
Claude Sonnet 4.662%

作者把 Gemini 3.6 Flash 称作其测试过的浏览器代理里性价比最高的模型,并写它仅次于 Opus 4.8。

结论

需要网页代理时,Sonnet 4.6 是可用的中档选择,但在 Browser Use 的公开对照里既不是最准也不是最便宜。若目标是纯浏览器自动化,应把 Gemini 3.6 Flash 和 GPT-5.6-sol 放进同一 harness 再决定;若目标是桌面+浏览器混合 computer use,这条 BU 分数不能替代 OSWorld。

局限

  • 只有四个百分数,没有逐任务日志。

  • 厂商在发布竞品对照时强调 Flash,Sonnet 4.6 是被比较的基线而非被优化对象。

  • 未说明 Sonnet 4.6 的 API 参数、是否 computer-use beta、截图分辨率。

  • 不能与 Anthropic 官方 OSWorld-Verified 72.5% 混成一张榜。

复现步骤

  1. 固定同一浏览器代理脚手架(或 Browser Use 公开 benchmark),分别接入 claude-sonnet-4-6、Gemini 3.6 Flash、GPT-5.6-sol。

  2. 记录成功率、步数、token、美元成本和卡住的页面类型(登录墙、动态 DOM、多标签表单)。

  3. 单独统计 prompt injection / 误点支付等安全失败。

  4. 不要把 BU% 与 OSWorld% 相加减。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Sonnet 4.6

在 Tabbit 中使用并对比模型

Claude Sonnet 4.6

相关测评

媒体Anthropic News / Introducing Sonnet 4.62026-02-17

Claude Sonnet 4.6 官方发布:编码、电脑使用与 Agent 基准

媒体BenchLM2026-08-17

BenchLM 对 Claude Sonnet 4.6 的公开证据账本

媒体IDP Leaderboard2026-03

IDP Leaderboard:Sonnet 4.6 在真实文档理解上与 Opus 4.6 持平

媒体Artificial Analysis

Artificial Analysis:Sonnet 4.6 非推理 Intelligence Index 37

Claude Sonnet 4.6

相关提示词

媒体Claude Platform Docs / Prompting best practices

Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示

媒体Claude Platform Docs / Effort 与 Prompting best practices

Claude Sonnet 4.6 的 effort 与工具触发配置

媒体Anthropic Platform Docs / Computer Use API Reference2026-02-17

Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流

媒体Anthropic Platform Docs / Context Management & Compaction2026-02-17

Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置