2025 年 ACL 論文《Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools》給出一個明確定義:這是「透過整合外部工具型智慧型代理來增強大模型推理」的框架。簡單說,模型不再一次性作答,而是規劃下一步、呼叫工具、讀取結果,再繼續推理。
使用者也會很快碰到它的短板。一位 Hacker News 留言者用 OpenAI Deep Research 研究他最熟悉的主題,也就是他自己,結果在一份 500 字的報告裡找出三個事實錯誤。即便如此,他仍認為它 "decent enough for a springboard",前提是你 "treat the output with caution and follow the links provided"。這個評價很準確:工具有用,但不能省掉查證。
OpenAI、Gemini、Perplexity 和瀏覽器智慧型代理的「深度研究」功能,都由這個迴圈驅動。面對一個廣泛的問題,工具會把迴圈跑上幾十遍,再交回一份帶引用的報告。下文依序說明智慧型代理推理、工具呼叫和推理迴圈如何銜接,以及迴圈怎樣變成深度研究。最後再看 Tabbit 瀏覽器 這類產品,如何在瀏覽器裡執行同一套機制。
關鍵結論
智慧型代理推理 = 推理加工具,迴圈進行。 模型規劃一步、採取行動(搜尋、程式碼、記憶查詢)、觀察結果,再繼續推理,而不是一次性作答。
工具呼叫是樞紐。 推理和工具使用是兩種不同能力;智慧型代理推理把它們結合起來,讓模型既能思考又能行動。
深度研究是這個迴圈的規模化執行。 同一個「規劃—行動—觀察—推理」迴圈,在大量來源上重複執行,把聊天模型變成研究智慧型代理。
機制相同,包裝不同。 ChatGPT、Gemini、Perplexity 和 Tabbit 這類瀏覽器智慧型代理都在執行某一版本的迴圈,差別在耗時、來源存取範圍和工作發生的位置。
輸出是帶引用的初稿,不是定論。 工具讀取公開網頁,仍可能產生幻覺,也會消耗更多模型呼叫。重要內容必須由人查證。
什麼是智慧型代理推理?
智慧型代理推理指大模型能夠自行決定下一步。給定一個目標,它會拆解子任務、選擇並執行工具、查看回傳結果,然後繼續推進,直到完成目標。單輪聊天機器人則不同:你發出提示,模型根據權重和有限情境給出回答,互動到此結束。
不同來源的定義略有差異,但描述的是同一套基本過程:
上述 arXiv 論文把它定義為「透過整合外部工具型智慧型代理來增強推理」,包括網路搜尋、程式碼執行,以及一個建構結構化知識圖譜、追蹤邏輯關係的「心智圖」智慧型代理。
IBM 把智慧型代理推理描述為 AI 智慧型代理中負責決策、讓它能自主行動的元件。
NVIDIA 把它框定為智慧型代理 AI 中「推理、規劃、行動」的基礎構件。
這裡的智慧型代理,指的是任務層面的自主。模型未必要在無人看管下執行數小時,只要能在任務中自行選擇下一步,而不是照著固定腳本執行即可。我們的什麼是智慧型代理瀏覽器一文進一步介紹這套機制如何進入瀏覽器。
從推理到工具使用:LLM 如何呼叫工具
模型只靠訓練權重和目前對話就能推理,但要行動,還需要工具。工具呼叫(也叫函式呼叫)負責連接這兩部分。
機制並不複雜。應用程式向模型提供可用工具列表,以及每個工具接受什麼輸入。當模型判斷需要外部資訊時,它不會寫一段自然語言的猜測,而是發出一個結構化呼叫(比如「執行這條搜尋」或「執行這段程式碼」)。應用程式執行該工具並把結果回傳,模型讀取結果後繼續。
兩個生產級例子:
OpenAI 函式呼叫讓模型發出一個結構化的函式請求,由應用程式執行後回傳。
Anthropic 工具使用遵循同樣的模式:模型請求一個工具,用戶端執行它,再把觀察結果回傳到對話裡。
這個往返過程區分了談論世界的模型和讀取世界的模型。聊天模型可能會說「最新資料大概是 X」;會用工具的模型則能發起搜尋、讀取真實頁面,再根據頁面作答。答案由新的外部證據支撐,而不只依賴訓練記憶。
推理迴圈:規劃 → 行動 → 觀察 → 推理
工具呼叫給了模型一雙手。推理迴圈告訴它怎麼用。最清晰的描述是 ReAct(Reason + Act),由 Yao 等人在 2022 年提出,它把步驟交錯成三類:
思考(推理)。 模型推理目前進展和下一步該做什麼。
行動。 它呼叫搜尋、程式碼執行或記憶查詢等工具。
觀察。 它讀取工具回傳的結果。
然後再回到推理。真實任務通常不是一組「思考—行動—觀察」就能完成,而是由一連串迴圈組成。模型在行動和觀察中取得新資訊,再據此修改計畫。論文發現,推理與行動交錯使用的效果更好:只推理的模型容易產生自信的幻覺,只行動的模型又缺乏選擇合適動作的規劃能力。
一個現代智慧型代理系統把這壓縮成四個反覆出現的動作:
規劃: 把目標拆成下一個子步驟。
行動: 呼叫合適的工具。
觀察: 讀取結果。
推理: 更新計畫並決定下一步。
arXiv 的《Agentic Reasoning》框架又給迴圈加上網路搜尋智慧型代理、程式碼執行智慧型代理,以及用知識圖譜記錄已有資訊的心智圖智慧型代理,避免長鏈條遺失線索。部署在 DeepSeek-R1 後,作者報告其結果在公開模型中達到 SOTA,可比肩 OpenAI Deep Research。這裡更值得關注的是方法本身:推理迴圈需要配上合適的工具。
這個迴圈如何變成深度研究
深度研究,就是把推理迴圈用在一個對單次搜尋而言過於廣泛的問題上。想像同一個「規劃—行動—觀察—推理」迴圈,但跨大量來源跑上幾十遍:
規劃研究。 智慧型代理讀取你的問題,識別子問題,並排出搜尋計畫。如果你要一份競爭格局,它可能把任務拆成市場地位、定價、功能集和近期動態。
搜尋並行動。 它執行多次查詢、開啟頁面,並在取得新資訊後更新計畫。「行動」和「觀察」會在這裡反覆進行。
跨來源推理。 它對比說法、標記衝突、過濾低相關材料。統整(synthesis)在這裡發生,而不只是羅列片段。
帶引用報告。 它寫出一份結構化文件,附上回到來源的連結,方便你逐條查證。
這就是深度研究需要幾分鐘而不是幾秒的原因。OpenAI Deep Research 的執行時間為五到三十分鐘;Perplexity Deep Research 通常在兩到四分鐘內完成。差異取決於迴圈次數,以及每次搜尋之間做了多少推理。更快的執行更便宜,但內容也更淺。執行時間更長,意味著更多推理和更高成本,而且仍可能出錯。
同樣的權衡在每個工具裡都出現。一旦你看清了迴圈,「深度研究」就不再是一個神秘功能,而變成關於三個工程選擇的問題:它迴圈多少次、能觸達哪些工具、你在哪裡看到來源?
深度研究方案對比
| 方案 | 推理風格 | 工具存取 | 來源可見性 | 最適合 |
|---|---|---|---|---|
| ChatGPT Deep Research | 長且推理密集的軌跡(5–30 分鐘) | 網路搜尋;MCP 整合 | 聊天中的推理摘要加引用 | 深度、推理密集的書面報告 |
| Gemini Deep Research | 先規劃再研究,可選 Workspace 內容 | 網路加 Google Docs / Drive / Gmail | 結構化計畫加帶引用的結果 | 與 Google Workspace 檔案混合的研究 |
| Perplexity Deep Research | 快速迭代搜尋(2–4 分鐘) | 網路;每任務數十次搜尋 | 行內引用,可匯出 PDF / Page | 可匯出的快速帶引用快照 |
| Tabbit 瀏覽器(Agent Mode) | 瀏覽器層迴圈,步驟可見 | 即時瀏覽器:頁面、分頁、檔案 | 來源分頁與答案並排保留 | 生活在開啟的分頁裡、最終要產出交付物的研究 |
耗時和配額經常變化,請把它當作快照,選擇前查閱各工具的最新頁面。
一個瀏覽器層的實際選項:Tabbit Deep Research
並非每個研究任務都適合放進聊天視窗或辦公套件。如果你平時就在瀏覽器裡讀文章、比較產品頁和填試算表,瀏覽器層的 AI 瀏覽器可以直接在同一個環境裡執行推理迴圈。這就是 Tabbit 的思路。
Tabbit 瀏覽器在瀏覽器視窗內執行 Agent Mode。你描述研究目標,Tabbit 隨後規劃搜尋、開啟相關頁面、讀取內容,並整理出結構化報告。它執行的仍是上文所說的「規劃—行動—觀察—推理」迴圈,只是把瀏覽器本身作為工具介面。

瀏覽器層方案有幾處實際差異:
附
@references 的瀏覽器情境。 你不必複製貼上情境,而是可以把已開啟的分頁、分頁群組、截圖、書籤或本地檔案附加到任務上。智慧型代理基於你正在看的內容做推理。來源保持可見。 原始頁面在答案旁邊保持開啟,核對一個說法只需瞥一眼,而不是在一篇長報告裡翻找。這直接回應了上一節那個「你在哪裡看到來源?」的問題。
多模型選擇。 Tabbit 可以把同一個任務路由給多個模型並排展示答案,當你拿不準哪個模型對你的主題推理得更好時很有用。
從研究到交付物。 因為智慧型代理控制著瀏覽器,它能把結果直接寫進線上試算表或文件,而不是只回傳純文字。

代價也很清楚。讓 Tabbit 靈活的這套瀏覽器自動化,同樣意味著它預設讀不到你的 Microsoft 365 郵件、Teams 聊天或 SharePoint 文件,除非你刻意把這些頁面作為情境分享。如果你的研究依賴內部工作內容,Gemini 或 Microsoft 365 Copilot Researcher 是更整合的選擇。如果你的研究主要是基於網頁或個人文件,Tabbit 讓來源頁面緊挨著答案,且無需跳躍到訂閱方案。關於更完整的工作流,我們的最佳實務指南介紹了如何從 Agent Mode 中獲得更多,研究者概覽和深度研究瀏覽器頁面則更詳細地描述了產品。選方案前請查看最新的 Tabbit 定價。
什麼時候該用智慧型代理深度研究,什麼時候不該
| 你的任務 | 最適合的方案 | 原因 |
|---|---|---|
| 快速、帶引用的市場快照 | Perplexity Deep Research | 最快,匯出簡單 |
| 深度、推理密集的書面報告 | ChatGPT Deep Research | 最長推理軌跡,顯式推理摘要 |
| 與 Google Workspace 檔案混合的研究 | Gemini Deep Research | 原生存取 Drive、Gmail、Docs |
| 生活在開啟分頁裡、最終產出交付物的研究 | Tabbit 瀏覽器 Agent Mode | 瀏覽器層執行,來源可見 |
| 讀取內部資料的企業研究 | Microsoft 365 Copilot Researcher | 透過 Microsoft Graph 授權存取工作資料 |
| 單一事實查詢 | 一般搜尋或一輪對話 | 不需要迴圈;深度研究是大材小用 |
表格最後一行很重要:如果一次搜尋就能回答問題,再跑幾十次只會浪費時間和 token。智慧型代理深度研究適合範圍較廣、涉及多個來源並且需要統整判斷的問題,這時迴圈的成本才有意義。
需要留意的限制
學術來源很明確地寫出智慧型代理推理的限制,使用者也該正視這些問題。
幻覺不會消失。 工具能讓模型更好地依據外部資訊作答,但 LLM 仍可能以高信心陳述錯誤內容。ReAct 論文的初衷之一是減少「只推理」帶來的幻覺,而非徹底消除。實務中也有記錄:一位資深開發者在 Hacker News 上寫道,LLM 最糟的地方在於 "simply being wrong, and then doubling down on it"。另一位拆解推理迴圈的實踐者把 "fabricated observations",也就是 "the agent imagines a response that it never actually got",列為常見陷阱,需要內建的審查步驟來攔截。
更多呼叫意味著更高成本和延遲。 迴圈的每一步都是一次模型呼叫。深度研究在設計上就比一輪對話更慢、更貴;免費方案受限正是這個原因。
來源品質仍由你把關。 工具讀的是公開網頁上的內容。過時頁面、行銷文案和低品質素材都可能混入統整,除非工具做了過濾。
私有和付費資料受限。 除非你上傳檔案或接入授權資料來源,否則這些系統看不到內部文件或訂閱研究。
查證仍是人的工作。 引用幫你核查,但不保證準確。對任何高風險說法,去讀原始來源。
把任何智慧型代理深度研究工具的輸出當作一份帶引用的初稿。它讓你比從零開始更快地拿到一份結構化摘要,但最終判斷仍在你。
最終結論
智慧型代理推理是一套機制,不是某個產品。LLM 在迴圈中規劃、呼叫工具、觀察結果,再繼續推理。工具呼叫讓模型可以行動,推理迴圈負責決定如何行動;深度研究則把同一個迴圈用在大量來源上,最後生成帶引用的報告。ChatGPT、Gemini、Perplexity 和瀏覽器智慧型代理的差異主要在產品實作:執行多久、能存取什麼,以及在哪裡顯示來源。
如果你主要使用聊天工具,並且需要較深的推理,ChatGPT Deep Research 是一個自然的起點。如果研究工作大多發生在瀏覽器裡,Tabbit 瀏覽器值得一試。你可以免費下載 macOS 或 Windows 版,執行研究任務時讓來源頁面一直留在眼前。產品功能會調整方案,甚至下線。微軟把 Copilot Deep Research 移到訂閱背後就是一例,詳情可參閱我們對 Copilot Deep Research 下線的記錄。相比具體產品,本文介紹的機制更不容易過時。
常見問題
什麼是 AI 中的智慧型代理推理?
智慧型代理推理指大模型能夠自行決定下一步做什麼——規劃一步、呼叫一個工具、讀取結果,然後繼續推理——而不是一次性作答。2025 年 ACL 的一篇論文把它形式化為「透過整合外部工具型智慧型代理(如網路搜尋、程式碼執行、結構化記憶)來增強 LLM 推理」的框架。
LLM 是怎麼使用工具的?
透過工具呼叫(也叫函式呼叫)。應用程式向模型提供可用工具列表及其輸入格式;當模型需要外部資訊時,它不再輸出自然語言猜測,而是發出一個結構化呼叫,由應用程式執行該工具,再把結果回傳給模型繼續推理。正是這一機制把聊天模型變成了能行動的模型。
推理和工具使用有什麼區別?
推理是模型逐步思考一個問題的過程;工具使用是模型在真實世界中採取行動,例如發起搜尋或執行程式碼。兩者是不同能力,但智慧型代理推理把它們結合起來:模型先推理該做什麼,再用工具去做,觀察結果,然後再推理。
智慧型代理推理如何驅動深度研究?
深度研究會把智慧型代理迴圈執行很多次。智慧型代理規劃子問題、搜尋網頁、閱讀並對比來源、根據新資訊更新計畫,最後寫出帶引用的報告。正是這個「規劃—行動—觀察—推理」的迴圈,讓深度研究能處理單次搜尋無法覆蓋的廣泛問題。
像 Tabbit 這樣的瀏覽器能做智慧型代理深度研究嗎?
可以。Tabbit 瀏覽器的 Agent Mode 能夠規劃搜尋、開啟分頁並產生結構化報告,同時保留來源分頁可見。它最適合公開網頁與個人文件類研究,而不是鎖在 Microsoft 365 等套件內的企業資料。
智慧型代理推理型 LLM 有哪些限制?
它們仍會產生幻覺,呼叫次數比單輪對話多、成本更高,並且可能以高信心給出錯誤答案。公開網頁上的來源品質參差不齊,所以輸出應被視為帶引用的初稿,需要人來查證。