Tabbit基准测试报告
简体中文

浏览器 Agent 基准测试 · 25 道题 × 3 次 × 3 套方案

为 Agent 提供最快、最省 Token 的浏览器超越 Codex,达到 SOTA 水平

Tabbit 是一款同时为人与 Agent 打造的 AI 浏览器。我们在一个详细的测评方案中对比了 Tabbit CLI 与 Codex 自带的 Chrome 接管方案以及 Vercel Labs 的 Agent Browser。结果是:在本次测试中,Tabbit CLI 速度最快,最节省 Token。

下载 Tabbit 浏览器后打开,在任意 Agent 中输入 /tabbit 就可以体验 Tabbit CLI 的 Browser-Use 方案

完整 25 题 · 每套方案 75 次运行 · 盲评判分全部 75 次运行

Tabbit最优

答对 · 64.0%
48/ 75 次运行
中位耗时
121.0s
每个正确答案的输入 Token
803K

Codex Chrome

答对 · 62.7%
47/ 75 次运行
中位耗时
141.2s
每个正确答案的输入 Token
1.57M

Agent Browser

答对 · 60.0%
45/ 75 次运行
中位耗时
209.6s
每个正确答案的输入 Token
2.06M

向下滚动查看完整数据

同一套题、同一个模型、同一台机器

只有三套方案面对同一份考卷、同样的条件,对比才有意义。下面是它们面对的到底是什么。

25 道题从哪里来

25 × 3 = 75

题目来自 BU Bench 题库 的 100 题集合,不是为这次实验临时编写的。我们从 5 个部分各抽取 5 道题;为减少针对性跑分,本页不公开具体题目。

题型来源题数
网页读取WebBench5
资料研究Mind2Web 25
网页交互BU Bench custom5
事实问答GAIA5
多步检索BrowseComp5

运行协议

gpt-5.6-luna
  • 三套方案都使用同一个模型 gpt-5.6-luna、中等思考强度和 30 分钟上限,每次都是全新的模型会话。
  • 每道题近同时启动三套方案,三者都结束后才开始下一题。它们共享同一台 Mac 和同一张网络。
  • 整套 25 题运行 3 次,每轮使用事先登记的不同题目顺序,不从三轮里挑最好成绩。每套方案 75 次,共 225 次。
  • Tabbit 使用固定的本地实例和独立 profile,启动参数带 --use-mock-keychain、--no-proxy-server。
  • Codex Chrome 使用专门的实验标签页,每次运行结束后关闭。
  • Agent Browser 使用 Vercel Labs agent-browser 0.35.2,作为稍后独立运行的单臂实验。

答案怎么判对错

  • 每个方案的答案都交给一个全新的 gpt-5.6-luna 高思考强度会话单独评分。
  • 评分时看不到浏览器名称,也不会把三个答案放在一起比较。
  • 评分模型看到题目、最终状态、最终答案和提交的来源。GAIA 与 BrowseComp 共 10 题提供标准答案,其余 15 题按题目要求检查最终回答。
  • 评分模型没有浏览器工具:不会打开来源网页,也不读取完整操作记录、DOM 或截图。运行方自报 completed 不会自动算对。

指标口径

Wall time

从 Agent 进程启动到交出结果的实际时间,包含模型思考、浏览器操作和 CLI 等待,不含之后的评分时间。

中位用时

把多次用时排序后取中间值,比平均值更不容易被一次超时拉高。

P90

90% 的运行不超过这个时间,用来观察少数特别慢的长尾任务。

工具调用

该次运行中模型发出的全部工具调用,不只包含点击和导航。

Token

run.json 记录的模型输入和输出 token,用于比较资源消耗,不是美元价格。

每个正确答案的成本

该方案全部 75 次尝试消耗的时间、Token 和工具调用,除以最终答对的题数。

实验过程信息

从固定题单到盲评结论,一共四步。

01固定题单在任何一次运行开始前,从 BU Bench 的 5 个部分各抽取 5 道题,并为三套方案固定使用同一题单。
02同题同轮启动每道题近同时启动三套方案,三者都交出结果后才进入下一题。
03三轮固定顺序整套题跑 3 次,每轮使用事先登记的不同题目顺序,不接受事后挑选结果。
04盲评判分匿名答案交给全新的评分会话,评分方看不到方案名称,也不做跨方案比较。

Tabbit 浏览器速度最快,花得最少

当 Agent 要批量跑任务时,正确率不是全部。每个正确答案要花多少代价,才决定账单和排队时间。

一个正确答案的真实成本

全部 75 次运行

把一套方案 75 次尝试消耗的全部时间、Token 和工具调用,除以它最终答对的题数。

每个正确答案耗时

Tabbit219.3
Codex Chrome227.9
Agent Browser422.9

每个正确答案输入 Token

Tabbit803,144
Codex Chrome1,574,503
Agent Browser2,057,883

每个正确答案输出 Token

Tabbit7,417
Codex Chrome7,686
Agent Browser10,266

每个正确答案工具调用

Tabbit20.1
Codex Chrome24.8
Agent Browser41.7
1.9×每个正确答案的耗时,对比 Agent Browser
−49%每个正确答案的输入 Token,对比 Codex Chrome
−52%每个正确答案的工具调用,对比 Agent Browser

Token 不是抽象数字——输入 Token 直接决定每一次调用的账单和上下文压力。三套方案用的是同一个模型,所以差距来自浏览器交给 Agent 的信息:信息更干净,操作路径更短。

速度:不只是平均更快

全部 75 次运行

每套方案全部 75 次运行,再看只看答对运行时的同一组数字。

方案答对 / 75中位耗时P90 耗时总耗时
Tabbit48 · 64.0%121.0s220.6s2.9h
Codex Chrome47 · 62.7%141.2s224.2s3.0h
Agent Browser45 · 60.0%209.6s489.0s5.3h
Tabbit121.0s
Codex Chrome141.2s
Agent Browser209.6s

只看答对的运行

同一批题、同一轮次,只统计评分正确的运行。
方案答对 / 75中位耗时P90 耗时平均耗时
Tabbit48 · 64.0%118.3s225.6s137.0s
Codex Chrome47 · 62.7%131.6s226.7s140.0s
Agent Browser45 · 60.0%185.1s481.3s230.6s
  • 中位耗时比 Codex Chrome 短 14%,比 Agent Browser 短 42%。
  • 长尾差距更明显:Agent Browser 有 10% 的任务拖到 489 秒以上,而 Tabbit 的 P90 是 220.6 秒。
  • 整套题跑下来,Tabbit 用了 2.92 小时墙钟时间,Agent Browser 需要 5.29 小时。
  • 只看答对的运行:平均 137.0 秒,对比 140.0 秒和 230.6 秒;中位 118.3 秒,对比 131.6 秒和 185.1 秒。

Token 与工具调用

全部 75 次运行

每套方案全部 75 次运行的总量,以及只看答对运行时的平均值。

Tabbit38.55M
Codex Chrome74.00M
Agent Browser92.60M
指标全部 75 次运行只看答对的运行
输入 Token38.55M / 74.00M / 92.60M550K / 954K / 1.16M
输出 Token356K / 361K / 462K5K / 5K / 6K
工具调用965 / 1,164 / 1,87513.6 / 15.4 / 24.3
  • Tabbit 的输入 Token 总量只有 Codex Chrome 的 52%、Agent Browser 的 42%。
  • 工具调用总数 965 次,对比 1,164 次和 1,875 次,分别少 17% 和 49%。
  • 只看答对的运行,平均输入 Token 是 549,906,对比 954,168 和 1,164,035。

正确率

每个答案都由不知道方案名称的评分模型裁定,所以自报 completed 从来不算答对。

  • 75 次运行答对次数:48 次(64.0%)、47 次(62.7%)、45 次(60.0%)。差距很小,前两名只差一次。
  • 同一题三次运行至少两次答对的题目数:16、14、15 道,分母是 25。
  • 没有哪套方案在所有题型上都占优。多步检索上 Codex Chrome 拿到 10/15,Tabbit 是 9/15;网页读取上 Tabbit 是 11,Codex Chrome 是 9。

按题型答对次数(每种题型 15 次运行)

Agent Browser 是稍后独立运行的单臂实验,没有同口径的按题型数据,因此这里只对比 Tabbit 与 Codex Chrome。
题型TabbitCodex Chrome
网页读取11 / 159 / 15
资料研究8 / 158 / 15
网页交互15 / 1515 / 15
事实问答5 / 155 / 15
多步检索9 / 1510 / 15

三套方案各自的位置

方案优势主要问题
Tabbit完整 25 题正确率最高;每个正确答案的耗时、输入 Token 和工具调用都最低;P90 长尾最短。主实验期间发生过 4 次运行故障。
Codex Chrome多步检索最好;网页交互全部成功。在三种方案都答对的运行上最慢、工具调用最多;每个正确答案的输入 Token 接近 Tabbit 的两倍。
Agent Browser网页交互与多数成功题目数量居中;开源、可自行部署。中位耗时、P90、总耗时和 Token 消耗都明显最高。

同一个模型,差别在浏览器给 Agent 的信息

三套方案用的是同一个模型、同样的思考强度,所以差距发生在浏览器这一侧。

01

信息更干净

页面结构、可交互元素和状态以更少的冗余传给模型,Agent 不必在噪声里反复找目标,也就少烧 Token。

02

路径更短

常见的导航、读取和填表动作被收敛成更少的步骤,模型不需要靠反复试错走到终点。

03

调用更少

75 次运行共 965 次工具调用,比 Codex Chrome 少 17%,比 Agent Browser 少 49%。调用越少,上下文越省,长尾越短。

Tabbit 浏览器正在网页上执行 Agent 任务,页面旁边显示 Agent 操作面板
本页所有数字都来自 browser-use-benchmark 仓库 2026-08-31 批次的同一份数据。

数据来源

实验数据来自于 Tabbit 浏览器团队。详细实验过程记录不包含在本页面中,如需交流,欢迎联系 support@tabbit.ai

关于这些数字的疑问

Tabbit CLI 比 Codex Chrome 快多少?

按每个正确答案计算,Tabbit 平均 219.3 秒,Codex Chrome 是 227.9 秒;中位运行 121.0 秒对比 141.2 秒。差距更大的是成本:每个正确答案 803,144 输入 Token,对比 1,574,503,少 49%;工具调用少约 20%。

Tabbit CLI 比 Agent Browser 快多少?

按每个正确答案计算,219.3 秒对比 422.9 秒,约快 1.9 倍;输入 Token 少 61%,工具调用约为一半。中位耗时 121.0 秒对比 209.6 秒。

正确率的差距算显著吗?

75 次运行中 Tabbit 答对 48 次(64.0%),Codex Chrome 47 次(62.7%),Agent Browser 45 次(60.0%)。差距很小,前两名只差一次运行,因此不能据此认定某一套方案稳定更强。

答案的对错是怎么判的?

每个答案都交给一个全新的评分会话,它看不到方案名称,也不会跨方案比较答案。它看到题目、最终状态、最终答案和提交的来源。自报 completed 不算答对。其中 10 道题提供标准答案,另外 15 道按题目要求检查最终回答。

这些结果可以复现吗?

题单、运行设置、各轮汇总、每个答案和评分结果都保存在核心数据包中。本页呈现的是汇总结果,不是重新跑一遍。

这次测试能说明什么,不能说明什么

这是在一组具体条件下进行的实用对比,不是严格控制变量的科学基准测试。

  • 三套方案的正确率分别为 64.0%、62.7% 和 60.0%,差异不大。当前样本不足以证明任何方案在正确性上稳定领先。
  • 本次只测试了 25 道题。后续还可以增加题目、网站、任务类型和重复批次,让结果更稳健。
  • 任务采用串行执行,并复用了浏览器环境。执行顺序、残留会话状态、缓存预热、限流和长时间运行产生的状态漂移,都可能影响后续结果。
  • 各方案的浏览器配置、用户数据、缓存以及网站在执行时的实时状态并不完全相同;Agent Browser 还是稍后进行的单臂实验。因此,这不是严格的科学基准测试。

即便存在这些限制,结果仍有方向性的参考价值:在本次测试条件下,Tabbit 完成任务更快,输入 Token 和工具调用也明显更少。速度与资源效率的差异比正确率的小幅差异更清晰,但仍建议用自己的真实任务进一步验证。

给你的 Agent 一个不浪费上下文的浏览器

Tabbit 是一款同时为人与 Agent 打造的 AI 浏览器。本次测评中,Tabbit CLI 对比 Codex 自带的 Chrome 接管方案与 Vercel Labs 的 Agent Browser,完成任务最快,也最节省 Token。

下载 Tabbit 浏览器后打开,在任意 Agent 中输入 /tabbit 就可以体验 Tabbit CLI 的 Browser-Use 方案