Browser Use 在自有 BU Benchmark 上给 Claude Sonnet 4.6 记 62%,低于 Gemini 3.6 Flash 的 68%、GPT-5.6-sol 的 67% 和 Opus 4.8 的 74%;它说明 4.6 能做浏览器代理,但不是该 harness 上性价比最高的选择。
任务:BU Benchmark,Browser Use 用于评估浏览器/网页代理。
对照模型:Gemini 3.6 Flash 68%;GPT-5.6-sol 67%;Claude Sonnet 4.6 62%;Claude Opus 4.8 74%。
发布语境:配合 Google DeepMind 发布 Gemini 3.6 Flash,强调 Flash 价格下的网页代理质量。
成本:帖文称 Gemini 3.6 Flash 成本远低于 Opus 4.8;未给出 Sonnet 4.6 的逐任务美元数。
X 帖未公开任务列表、浏览器环境、步数上限、是否截图、Sonnet 是否启用 computer-use 工具,以及 effort/thinking。分数只在 Browser Use 的 harness 内可比。
| 模型 | BU Benchmark |
|---|---|
| Claude Opus 4.8 | 74% |
| Gemini 3.6 Flash | 68% |
| GPT-5.6-sol | 67% |
| Claude Sonnet 4.6 | 62% |
作者把 Gemini 3.6 Flash 称作其测试过的浏览器代理里性价比最高的模型,并写它仅次于 Opus 4.8。
需要网页代理时,Sonnet 4.6 是可用的中档选择,但在 Browser Use 的公开对照里既不是最准也不是最便宜。若目标是纯浏览器自动化,应把 Gemini 3.6 Flash 和 GPT-5.6-sol 放进同一 harness 再决定;若目标是桌面+浏览器混合 computer use,这条 BU 分数不能替代 OSWorld。
只有四个百分数,没有逐任务日志。
厂商在发布竞品对照时强调 Flash,Sonnet 4.6 是被比较的基线而非被优化对象。
未说明 Sonnet 4.6 的 API 参数、是否 computer-use beta、截图分辨率。
不能与 Anthropic 官方 OSWorld-Verified 72.5% 混成一张榜。
固定同一浏览器代理脚手架(或 Browser Use 公开 benchmark),分别接入 claude-sonnet-4-6、Gemini 3.6 Flash、GPT-5.6-sol。
记录成功率、步数、token、美元成本和卡住的页面类型(登录墙、动态 DOM、多标签表单)。
单独统计 prompt injection / 误点支付等安全失败。
不要把 BU% 与 OSWorld% 相加减。
Claude Sonnet 4.6