01
資訊更乾淨
網頁結構、可互動元素與狀態以更少的冗餘傳給模型,Agent 不必在雜訊裡反覆找目標,也就少燒 Token。
瀏覽器 Agent 基準測試 · 25 道題 × 3 次 × 3 套方案
Tabbit 是一款同時為人與 Agent 打造的 AI 瀏覽器。我們在一個詳細的評測方案中對比了 Tabbit CLI 與 Codex 內建的 Chrome 接管方案以及 Vercel Labs 的 Agent Browser。結果是:在本次測試中,Tabbit CLI 速度最快、最節省 Token。
下載 Tabbit 瀏覽器後打開,在任意 Agent 中輸入 /tabbit 就可以體驗 Tabbit CLI 的 Browser-Use 方案
Tabbit最佳
Codex Chrome
Agent Browser
向下捲動查看完整資料
只有三套方案面對同一份考卷、同樣的條件,比較才有意義。以下是它們真正面對的內容。
題目來自 BU Bench 題庫 的 100 題集合,不是為這次實驗臨時編寫的。我們從 5 個部分各抽取 5 道題;為減少針對性跑分,本頁不公開具體題目。
| 題型 | 來源 | 題數 |
|---|---|---|
| 網頁讀取 | WebBench | 5 |
| 資料研究 | Mind2Web 2 | 5 |
| 網頁互動 | BU Bench custom | 5 |
| 事實問答 | GAIA | 5 |
| 多步檢索 | BrowseComp | 5 |
Wall time
從 Agent 行程啟動到交出結果的實際時間,包含模型思考、瀏覽器操作與 CLI 等待,不含之後的評分時間。
中位耗時
把多次耗時排序後取中間值,比平均值更不容易被一次逾時拉高。
P90
90% 的執行不超過這個時間,用來觀察少數特別慢的長尾任務。
工具呼叫
該次執行中模型發出的全部工具呼叫,不只包含點擊與導覽。
Token
run.json 記錄的模型輸入與輸出 token,用於比較資源消耗,不是美元價格。
每個正確答案的成本
該方案全部 75 次嘗試消耗的時間、Token 與工具呼叫,除以最終答對的題數。
從固定題單到盲評結論,一共四步。
當 Agent 要批次執行任務時,正確率不是全部。每個正確答案要花多少代價,才決定帳單與排隊時間。
把一套方案 75 次嘗試消耗的全部時間、Token 與工具呼叫,除以它最終答對的題數。
每個正確答案耗時
每個正確答案輸入 Token
每個正確答案輸出 Token
每個正確答案工具呼叫
Token 不是抽象數字——輸入 Token 直接決定每一次呼叫的帳單與上下文壓力。三套方案用的是同一個模型,所以差距來自瀏覽器交給 Agent 的資訊:資訊更乾淨,操作路徑更短。
每套方案全部 75 次執行,再看只看答對執行時的同一組數字。
| 方案 | 答對 / 75 | 中位耗時 | P90 耗時 | 總耗時 |
|---|---|---|---|---|
| Tabbit | 48 · 64.0% | 121.0s | 220.6s | 2.9h |
| Codex Chrome | 47 · 62.7% | 141.2s | 224.2s | 3.0h |
| Agent Browser | 45 · 60.0% | 209.6s | 489.0s | 5.3h |
| 方案 | 答對 / 75 | 中位耗時 | P90 耗時 | 平均耗時 |
|---|---|---|---|---|
| Tabbit | 48 · 64.0% | 118.3s | 225.6s | 137.0s |
| Codex Chrome | 47 · 62.7% | 131.6s | 226.7s | 140.0s |
| Agent Browser | 45 · 60.0% | 185.1s | 481.3s | 230.6s |
每套方案全部 75 次執行的總量,以及只看答對執行時的平均值。
| 指標 | 全部 75 次執行 | 只看答對的執行 |
|---|---|---|
| 輸入 Token | 38.55M / 74.00M / 92.60M | 550K / 954K / 1.16M |
| 輸出 Token | 356K / 361K / 462K | 5K / 5K / 6K |
| 工具呼叫 | 965 / 1,164 / 1,875 | 13.6 / 15.4 / 24.3 |
每個答案都由不知道方案名稱的評分模型裁定,所以自報 completed 從來不算答對。
| 題型 | Tabbit | Codex Chrome |
|---|---|---|
| 網頁讀取 | 11 / 15 | 9 / 15 |
| 資料研究 | 8 / 15 | 8 / 15 |
| 網頁互動 | 15 / 15 | 15 / 15 |
| 事實問答 | 5 / 15 | 5 / 15 |
| 多步檢索 | 9 / 15 | 10 / 15 |
| 方案 | 優勢 | 主要問題 |
|---|---|---|
| Tabbit | 完整 25 題正確率最高;每個正確答案的耗時、輸入 Token 與工具呼叫都最低;P90 長尾最短。 | 主實驗期間發生過 4 次執行故障。 |
| Codex Chrome | 多步檢索最好;網頁互動全部成功。 | 在三種方案都答對的執行上最慢、工具呼叫最多;每個正確答案的輸入 Token 接近 Tabbit 的兩倍。 |
| Agent Browser | 網頁互動與多數成功題數居中;開源、可自行部署。 | 中位耗時、P90、總耗時與 Token 消耗都明顯最高。 |
三套方案用的是同一個模型、同樣的思考強度,所以差距發生在瀏覽器這一側。
01
網頁結構、可互動元素與狀態以更少的冗餘傳給模型,Agent 不必在雜訊裡反覆找目標,也就少燒 Token。
02
常見的導覽、讀取與填表動作被收斂成更少的步驟,模型不需要靠反覆試錯走到終點。
03
75 次執行共 965 次工具呼叫,比 Codex Chrome 少 17%,比 Agent Browser 少 49%。呼叫越少,上下文越省,長尾越短。

實驗資料來自 Tabbit 瀏覽器團隊。詳細實驗過程紀錄不包含在本頁面中,如需交流,歡迎聯繫 support@tabbit.ai。
依每個正確答案計算,Tabbit 平均 219.3 秒,Codex Chrome 是 227.9 秒;中位執行 121.0 秒對比 141.2 秒。差距更大的是成本:每個正確答案 803,144 輸入 Token,對比 1,574,503,少 49%;工具呼叫少約 20%。
依每個正確答案計算,219.3 秒對比 422.9 秒,約快 1.9 倍;輸入 Token 少 61%,工具呼叫約為一半。中位耗時 121.0 秒對比 209.6 秒。
75 次執行中 Tabbit 答對 48 次(64.0%),Codex Chrome 47 次(62.7%),Agent Browser 45 次(60.0%)。差距很小,前兩名只差一次執行,因此不能據此認定某一套方案穩定更強。
每個答案都交給一個全新的評分工作階段,它看不到方案名稱,也不會跨方案比較答案。它看到題目、最終狀態、最終答案與提交的來源。自報 completed 不算答對。其中 10 道題提供標準答案,另外 15 道依題目要求檢查最終回答。
題單、執行設定、各輪彙總、每個答案與評分結果都保存在核心資料包中。本頁呈現的是彙總結果,不是重新跑一遍。
這是在一組具體條件下進行的實用對比,不是嚴格控制變因的科學基準測試。
即使存在這些限制,結果仍有方向性的參考價值:在本次測試條件下,Tabbit 完成任務更快,輸入 Token 與工具呼叫也明顯更少。速度與資源效率的差異比正確率的小幅差異更清晰,但仍建議用自己的真實任務進一步驗證。
Tabbit 是一款同時為人與 Agent 打造的 AI 瀏覽器。本次評測中,Tabbit CLI 對比 Codex 內建的 Chrome 接管方案與 Vercel Labs 的 Agent Browser,完成任務最快,也最節省 Token。
下載 Tabbit 瀏覽器後打開,在任意 Agent 中輸入 /tabbit 就可以體驗 Tabbit CLI 的 Browser-Use 方案