Tabbit基準測試報告
繁體中文

瀏覽器 Agent 基準測試 · 25 道題 × 3 次 × 3 套方案

為 Agent 提供最快、最省 Token 的瀏覽器超越 Codex,達到 SOTA 水準

Tabbit 是一款同時為人與 Agent 打造的 AI 瀏覽器。我們在一個詳細的評測方案中對比了 Tabbit CLI 與 Codex 內建的 Chrome 接管方案以及 Vercel Labs 的 Agent Browser。結果是:在本次測試中,Tabbit CLI 速度最快、最節省 Token。

下載 Tabbit 瀏覽器後打開,在任意 Agent 中輸入 /tabbit 就可以體驗 Tabbit CLI 的 Browser-Use 方案

完整 25 題 · 每套方案 75 次執行 · 盲評計分全部 75 次執行

Tabbit最佳

答對 · 64.0%
48/ 75 次執行
中位耗時
121.0s
每個正確答案的輸入 Token
803K

Codex Chrome

答對 · 62.7%
47/ 75 次執行
中位耗時
141.2s
每個正確答案的輸入 Token
1.57M

Agent Browser

答對 · 60.0%
45/ 75 次執行
中位耗時
209.6s
每個正確答案的輸入 Token
2.06M

向下捲動查看完整資料

同一套題、同一個模型、同一台機器

只有三套方案面對同一份考卷、同樣的條件,比較才有意義。以下是它們真正面對的內容。

25 道題從哪裡來

25 × 3 = 75

題目來自 BU Bench 題庫 的 100 題集合,不是為這次實驗臨時編寫的。我們從 5 個部分各抽取 5 道題;為減少針對性跑分,本頁不公開具體題目。

題型來源題數
網頁讀取WebBench5
資料研究Mind2Web 25
網頁互動BU Bench custom5
事實問答GAIA5
多步檢索BrowseComp5

執行協議

gpt-5.6-luna
  • 三套方案都使用同一個模型 gpt-5.6-luna、中等思考強度與 30 分鐘上限,每次都是全新的模型工作階段。
  • 每道題近乎同時啟動三套方案,三者都結束後才開始下一題。它們共用同一台 Mac 與同一張網路。
  • 整套 25 題執行 3 次,每輪使用事先登記的不同題目順序,不從三輪裡挑最好成績。每套方案 75 次,共 225 次。
  • Tabbit 使用固定的本機實例與獨立 profile,啟動參數帶 --use-mock-keychain、--no-proxy-server。
  • Codex Chrome 使用專門的實驗分頁,每次執行結束後關閉。
  • Agent Browser 使用 Vercel Labs agent-browser 0.35.2,作為稍後獨立執行的單臂實驗。

答案怎麼判定對錯

  • 每個方案的答案都交給一個全新的 gpt-5.6-luna 高思考強度工作階段單獨評分。
  • 評分時看不到瀏覽器名稱,也不會把三個答案放在一起比較。
  • 評分模型看到題目、最終狀態、最終答案與提交的來源。GAIA 與 BrowseComp 共 10 題提供標準答案,其餘 15 題依題目要求檢查最終回答。
  • 評分模型沒有瀏覽器工具:不會打開來源網頁,也不讀取完整操作紀錄、DOM 或截圖。執行方自報 completed 不會自動算對。

指標定義

Wall time

從 Agent 行程啟動到交出結果的實際時間,包含模型思考、瀏覽器操作與 CLI 等待,不含之後的評分時間。

中位耗時

把多次耗時排序後取中間值,比平均值更不容易被一次逾時拉高。

P90

90% 的執行不超過這個時間,用來觀察少數特別慢的長尾任務。

工具呼叫

該次執行中模型發出的全部工具呼叫,不只包含點擊與導覽。

Token

run.json 記錄的模型輸入與輸出 token,用於比較資源消耗,不是美元價格。

每個正確答案的成本

該方案全部 75 次嘗試消耗的時間、Token 與工具呼叫,除以最終答對的題數。

實驗過程資訊

從固定題單到盲評結論,一共四步。

01固定題單在任何一次執行開始前,從 BU Bench 的 5 個部分各抽取 5 道題,並為三套方案固定使用同一題單。
02同題同輪啟動每道題近乎同時啟動三套方案,三者都交出結果後才進入下一題。
03三輪固定順序整套題跑 3 次,每輪使用事先登記的不同題目順序,不接受事後挑選結果。
04盲評計分匿名答案交給全新的評分工作階段,評分方看不到方案名稱,也不做跨方案比較。

Tabbit 瀏覽器速度最快,花得最少

當 Agent 要批次執行任務時,正確率不是全部。每個正確答案要花多少代價,才決定帳單與排隊時間。

一個正確答案的真實成本

全部 75 次執行

把一套方案 75 次嘗試消耗的全部時間、Token 與工具呼叫,除以它最終答對的題數。

每個正確答案耗時

Tabbit219.3
Codex Chrome227.9
Agent Browser422.9

每個正確答案輸入 Token

Tabbit803,144
Codex Chrome1,574,503
Agent Browser2,057,883

每個正確答案輸出 Token

Tabbit7,417
Codex Chrome7,686
Agent Browser10,266

每個正確答案工具呼叫

Tabbit20.1
Codex Chrome24.8
Agent Browser41.7
1.9×每個正確答案的耗時,對比 Agent Browser
−49%每個正確答案的輸入 Token,對比 Codex Chrome
−52%每個正確答案的工具呼叫,對比 Agent Browser

Token 不是抽象數字——輸入 Token 直接決定每一次呼叫的帳單與上下文壓力。三套方案用的是同一個模型,所以差距來自瀏覽器交給 Agent 的資訊:資訊更乾淨,操作路徑更短。

速度:不只是平均更快

全部 75 次執行

每套方案全部 75 次執行,再看只看答對執行時的同一組數字。

方案答對 / 75中位耗時P90 耗時總耗時
Tabbit48 · 64.0%121.0s220.6s2.9h
Codex Chrome47 · 62.7%141.2s224.2s3.0h
Agent Browser45 · 60.0%209.6s489.0s5.3h
Tabbit121.0s
Codex Chrome141.2s
Agent Browser209.6s

只看答對的執行

同一批題、同一輪次,只統計評分正確的執行。
方案答對 / 75中位耗時P90 耗時平均耗時
Tabbit48 · 64.0%118.3s225.6s137.0s
Codex Chrome47 · 62.7%131.6s226.7s140.0s
Agent Browser45 · 60.0%185.1s481.3s230.6s
  • 中位耗時比 Codex Chrome 短 14%,比 Agent Browser 短 42%。
  • 長尾差距更明顯:Agent Browser 有 10% 的任務拖到 489 秒以上,而 Tabbit 的 P90 是 220.6 秒。
  • 整套題跑下來,Tabbit 用了 2.92 小時牆鐘時間,Agent Browser 需要 5.29 小時。
  • 只看答對的執行:平均 137.0 秒,對比 140.0 秒與 230.6 秒;中位 118.3 秒,對比 131.6 秒與 185.1 秒。

Token 與工具呼叫

全部 75 次執行

每套方案全部 75 次執行的總量,以及只看答對執行時的平均值。

Tabbit38.55M
Codex Chrome74.00M
Agent Browser92.60M
指標全部 75 次執行只看答對的執行
輸入 Token38.55M / 74.00M / 92.60M550K / 954K / 1.16M
輸出 Token356K / 361K / 462K5K / 5K / 6K
工具呼叫965 / 1,164 / 1,87513.6 / 15.4 / 24.3
  • Tabbit 的輸入 Token 總量只有 Codex Chrome 的 52%、Agent Browser 的 42%。
  • 工具呼叫總數 965 次,對比 1,164 次與 1,875 次,分別少 17% 與 49%。
  • 只看答對的執行,平均輸入 Token 是 549,906,對比 954,168 與 1,164,035。

正確率

每個答案都由不知道方案名稱的評分模型裁定,所以自報 completed 從來不算答對。

  • 75 次執行答對次數:48 次(64.0%)、47 次(62.7%)、45 次(60.0%)。差距很小,前兩名只差一次。
  • 同一題三次執行至少兩次答對的題數:16、14、15 道,分母是 25。
  • 沒有哪套方案在所有題型上都占優。多步檢索上 Codex Chrome 拿到 10/15,Tabbit 是 9/15;網頁讀取上 Tabbit 是 11,Codex Chrome 是 9。

依題型答對次數(每種題型 15 次執行)

Agent Browser 是稍後獨立執行的單臂實驗,沒有同口徑的依題型資料,因此這裡只對比 Tabbit 與 Codex Chrome。
題型TabbitCodex Chrome
網頁讀取11 / 159 / 15
資料研究8 / 158 / 15
網頁互動15 / 1515 / 15
事實問答5 / 155 / 15
多步檢索9 / 1510 / 15

三套方案各自的位置

方案優勢主要問題
Tabbit完整 25 題正確率最高;每個正確答案的耗時、輸入 Token 與工具呼叫都最低;P90 長尾最短。主實驗期間發生過 4 次執行故障。
Codex Chrome多步檢索最好;網頁互動全部成功。在三種方案都答對的執行上最慢、工具呼叫最多;每個正確答案的輸入 Token 接近 Tabbit 的兩倍。
Agent Browser網頁互動與多數成功題數居中;開源、可自行部署。中位耗時、P90、總耗時與 Token 消耗都明顯最高。

同一個模型,差別在瀏覽器給 Agent 的資訊

三套方案用的是同一個模型、同樣的思考強度,所以差距發生在瀏覽器這一側。

01

資訊更乾淨

網頁結構、可互動元素與狀態以更少的冗餘傳給模型,Agent 不必在雜訊裡反覆找目標,也就少燒 Token。

02

路徑更短

常見的導覽、讀取與填表動作被收斂成更少的步驟,模型不需要靠反覆試錯走到終點。

03

呼叫更少

75 次執行共 965 次工具呼叫,比 Codex Chrome 少 17%,比 Agent Browser 少 49%。呼叫越少,上下文越省,長尾越短。

Tabbit 瀏覽器正在網頁上執行 Agent 任務,頁面旁邊顯示 Agent 操作面板
本頁所有數字都來自 browser-use-benchmark 儲存庫 2026-08-31 批次的同一份資料。

資料來源

實驗資料來自 Tabbit 瀏覽器團隊。詳細實驗過程紀錄不包含在本頁面中,如需交流,歡迎聯繫 support@tabbit.ai

關於這些數字的疑問

Tabbit CLI 比 Codex Chrome 快多少?

依每個正確答案計算,Tabbit 平均 219.3 秒,Codex Chrome 是 227.9 秒;中位執行 121.0 秒對比 141.2 秒。差距更大的是成本:每個正確答案 803,144 輸入 Token,對比 1,574,503,少 49%;工具呼叫少約 20%。

Tabbit CLI 比 Agent Browser 快多少?

依每個正確答案計算,219.3 秒對比 422.9 秒,約快 1.9 倍;輸入 Token 少 61%,工具呼叫約為一半。中位耗時 121.0 秒對比 209.6 秒。

正確率的差距算顯著嗎?

75 次執行中 Tabbit 答對 48 次(64.0%),Codex Chrome 47 次(62.7%),Agent Browser 45 次(60.0%)。差距很小,前兩名只差一次執行,因此不能據此認定某一套方案穩定更強。

答案的對錯是怎麼判的?

每個答案都交給一個全新的評分工作階段,它看不到方案名稱,也不會跨方案比較答案。它看到題目、最終狀態、最終答案與提交的來源。自報 completed 不算答對。其中 10 道題提供標準答案,另外 15 道依題目要求檢查最終回答。

這些結果可以重現嗎?

題單、執行設定、各輪彙總、每個答案與評分結果都保存在核心資料包中。本頁呈現的是彙總結果,不是重新跑一遍。

這次測試能說明什麼,不能說明什麼

這是在一組具體條件下進行的實用對比,不是嚴格控制變因的科學基準測試。

  • 三套方案的正確率分別為 64.0%、62.7% 與 60.0%,差異不大。目前的樣本不足以證明任何方案在正確性上穩定領先。
  • 本次只測試了 25 道題。後續還可以增加題目、網站、任務類型與重複批次,讓結果更穩健。
  • 任務採用串行執行,並復用了瀏覽器環境。執行順序、殘留工作階段狀態、快取預熱、限流與長時間執行產生的狀態漂移,都可能影響後續結果。
  • 各方案的瀏覽器設定、使用者資料、快取以及網站在執行時的即時狀態並不完全相同;Agent Browser 也是稍後進行的單臂實驗。因此,這不是嚴格的科學基準測試。

即使存在這些限制,結果仍有方向性的參考價值:在本次測試條件下,Tabbit 完成任務更快,輸入 Token 與工具呼叫也明顯更少。速度與資源效率的差異比正確率的小幅差異更清晰,但仍建議用自己的真實任務進一步驗證。

給你的 Agent 一個不浪費上下文的瀏覽器

Tabbit 是一款同時為人與 Agent 打造的 AI 瀏覽器。本次評測中,Tabbit CLI 對比 Codex 內建的 Chrome 接管方案與 Vercel Labs 的 Agent Browser,完成任務最快,也最節省 Token。

下載 Tabbit 瀏覽器後打開,在任意 Agent 中輸入 /tabbit 就可以體驗 Tabbit CLI 的 Browser-Use 方案