TabbitBlog

智能体推理:LLM 如何用工具驱动深度研究

智能体推理让 LLM 能够规划、调用工具并在循环中持续推理——它是深度研究背后的引擎。本文讲清它如何运作、工具如何融入,以及 Tabbit 如何把这一循环搬进浏览器。

本文目录
  1. 关键结论
  2. 什么是智能体推理?
  3. 从推理到工具使用:LLM 如何调用工具
  4. 推理循环:规划 → 行动 → 观察 → 推理
  5. 这个循环如何变成深度研究
  6. 深度研究方案对比
  7. 一个浏览器层的实际选项:Tabbit Deep Research
  8. 什么时候该用智能体深度研究,什么时候不该
  9. 需要留意的局限
  10. 最终结论

2025 年 ACL 论文《Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools》给出了一个明确的定义:这是一个「通过集成外部工具型智能体来增强大模型推理」的框架。简单说,模型不再一次性作答,而是规划下一步、调用工具、读取结果,再继续推理。

用户也会很快碰到它的短板。一位 Hacker News 评论者用 OpenAI Deep Research 研究他最熟悉的主题,也就是他自己,结果在一份 500 词的报告里找出三处事实错误。即便如此,他仍认为它「decent enough for a springboard」,前提是你「treat the output with caution and follow the links provided」。这个评价很准确:工具有用,但不能省掉核对。

OpenAI、Gemini、Perplexity 和浏览器智能体的「深度研究」功能,都由这个循环驱动。面对一个宽泛的问题,工具会把循环跑上几十遍,再交回一份带引用的报告。下面会依次说明智能体推理、工具调用和推理循环如何衔接,以及循环怎样变成深度研究。最后再看 Tabbit 浏览器 这类产品,如何在浏览器里运行同一套机制。

关键结论

  • 智能体推理 = 推理加工具,循环进行。 模型规划一步、采取行动(搜索、代码、记忆查询)、观察结果,再继续推理,而不是一次性作答。

  • 工具调用是枢纽。 推理和工具使用是两种不同能力;智能体推理把它们结合起来,让模型既能思考又能行动。

  • 深度研究是这个循环的规模化运行。 同一个「规划—行动—观察—推理」循环,在大量来源上重复执行,把聊天模型变成研究智能体。

  • 机制相同,包装不同。 ChatGPT、Gemini、Perplexity 和 Tabbit 这类浏览器智能体都在运行某一版本的循环,差别在耗时、来源访问范围和工作发生的位置。

  • 输出是带引用的初稿,不是定论。 工具读取公开网页,仍可能产生幻觉,也要消耗更多模型调用。重要内容必须由人核实。

什么是智能体推理?

智能体推理指大模型能够自行决定下一步。给定一个目标,它会拆解子任务、选择并运行工具、查看返回结果,然后继续推进,直到完成目标。单轮聊天机器人则不同:你发出提示,模型根据权重和有限上下文给出回答,交互到此结束。

不同来源的定义略有差异,但描述的是同一套基本过程:

  • 上述 arXiv 论文把它定义为「通过集成外部工具型智能体来增强推理」,包括网络搜索、代码执行,以及一个构建结构化知识图谱、跟踪逻辑关系的「思维导图」智能体。

  • IBM 把智能体推理描述为 AI 智能体中负责决策、让它能自主行动的组件。

  • NVIDIA 把它框定为智能体 AI 中「推理、规划、行动」的基础构件。

这里的智能体,指的是任务层面的自主。模型未必要无人值守地运行数小时,只要能在任务中自行选择下一步,而不是照着固定脚本执行即可。我们的什么是智能体浏览器一文进一步介绍了这套机制如何进入浏览器。

从推理到工具使用:LLM 如何调用工具

模型只靠训练权重和当前对话就能推理,但要行动,还需要工具。工具调用(也叫函数调用)负责连接这两部分。

机制并不复杂。应用向模型提供可用工具列表,以及每个工具接受什么输入。当模型判断需要外部信息时,它不会写一段自然语言的猜测,而是发出一个结构化调用(比如「执行这条搜索」或「运行这段代码」)。应用运行该工具并把结果回传,模型读取结果后继续。

两个生产级例子:

  • OpenAI 函数调用让模型发出一个结构化的函数请求,由应用执行后返回。

  • Anthropic 工具使用遵循同样的模式:模型请求一个工具,客户端运行它,再把观察结果回传到对话里。

这个往返过程区分了谈论世界的模型和读取世界的模型。聊天模型可能会说「最新数据大概是 X」;会用工具的模型则能发起搜索、读取真实页面,再根据页面作答。答案由新的外部证据支撑,而不只依赖训练记忆。

推理循环:规划 → 行动 → 观察 → 推理

工具调用给了模型一双手。推理循环告诉它怎么用。最清晰的描述是 ReAct(Reason + Act),由 Yao 等人在 2022 年提出,它把步骤交错成三类:

  1. 思考(推理)。 模型推理当前进展和下一步该做什么。

  2. 行动。 它调用搜索、代码执行或记忆查询等工具。

  3. 观察。 它读取工具返回的结果。

然后再回到推理。真实任务通常不是一组「思考—行动—观察」就能完成,而是由一连串循环组成。模型在行动和观察中得到新信息,再据此修改计划。论文发现,推理与行动交错使用的效果更好:只推理的模型容易产生自信的幻觉,只行动的模型又缺乏选择合适动作的规划能力。

一个现代智能体系统把这压缩成四个反复出现的动作:

  • 规划: 把目标拆成下一个子步骤。

  • 行动: 调用合适的工具。

  • 观察: 读取结果。

  • 推理: 更新计划并决定下一步。

arXiv 的《Agentic Reasoning》框架又给循环加上网络搜索智能体、代码执行智能体,以及用知识图谱记录已有信息的思维导图智能体,避免长链条丢失线索。部署在 DeepSeek-R1 后,作者报告其结果在公开模型中达到 SOTA,可比肩 OpenAI Deep Research。这里更值得关注的是方法本身:推理循环需要配上合适的工具。

这个循环如何变成深度研究

深度研究,就是把推理循环用在一个对单次搜索而言过于宽泛的问题上。想象同一个「规划—行动—观察—推理」循环,但跨大量来源跑上几十遍:

  1. 规划研究。 智能体读取你的问题,识别子问题,并排出搜索计划。如果你要一份竞争格局,它可能把任务拆成市场地位、定价、功能集和近期动态。

  2. 搜索并行动。 它运行多次查询、打开页面,并在获取新信息后更新计划。「行动」和「观察」会在这里反复进行。

  3. 跨来源推理。 它对比说法、标记冲突、过滤低相关材料。综合(synthesis)在这里发生,而不只是罗列片段。

  4. 带引用报告。 它写出一份结构化文档,附上回到来源的链接,方便你逐条核实。

这就是深度研究需要几分钟而不是几秒的原因。OpenAI Deep Research 的运行时间为五到三十分钟;Perplexity Deep Research 通常在两到四分钟内完成。差异取决于循环次数,以及每次搜索之间做了多少推理。更快的运行更便宜,但内容也更浅。运行时间更长,意味着更多推理和更高成本,而且仍可能出错。

同样的权衡在每个工具里都出现。一旦你看清了循环,「深度研究」就不再是一个神秘功能,而变成关于三个工程选择的问题:它循环多少次、能触达哪些工具、你在哪里看到来源?

深度研究方案对比

方案推理风格工具访问来源可见性最适合
ChatGPT Deep Research长且推理密集的轨迹(5–30 分钟)网络搜索;MCP 集成聊天中的推理摘要加引用深度、推理密集的书面报告
Gemini Deep Research先规划再研究,可选 Workspace 内容网络加 Google Docs / Drive / Gmail结构化计划加带引用的结果与 Google Workspace 文件混合的研究
Perplexity Deep Research快速迭代搜索(2–4 分钟)网络;每任务数十次搜索行内引用,可导出 PDF / Page可导出的快速带引用快照
Tabbit 浏览器(Agent Mode)浏览器层循环,步骤可见实时浏览器:页面、标签页、文件来源标签页与答案并排保留生活在打开的标签页里、最终要产出交付物的研究

耗时和配额经常变化,请把它当作快照,选择前查阅各工具的当前页面。

一个浏览器层的实际选项:Tabbit Deep Research

并非每个研究任务都适合放进聊天窗口或办公套件。如果你平时就在浏览器里读文章、对比产品页和填表格,浏览器层的 AI 浏览器可以直接在同一个环境里运行推理循环。这就是 Tabbit 的思路。

Tabbit 浏览器在浏览器窗口内运行 Agent Mode。你描述研究目标,Tabbit 随后规划搜索、打开相关页面、读取内容,并整理出结构化报告。它运行的仍是上文所说的「规划—行动—观察—推理」循环,只是把浏览器本身作为工具界面。

Tabbit 浏览器在 Agent 侧边栏中执行 Deep Research 任务,界面中可见搜索结果与执行步骤
Tabbit 的 Deep Research 流程会展示每个执行步骤,并保留来源页面供核实。

浏览器层方案有几处实际差异:

  • @ 引用的浏览器上下文。 你不必复制粘贴上下文,而是可以把已打开的标签页、标签组、截图、书签或本地文件附加到任务上。智能体基于你正在看的内容做推理。

  • 来源保持可见。 原始页面在答案旁边保持打开,核对一个说法只需瞥一眼,而不是在一篇长报告里翻找。这直接回应了上一节那个「你在哪里看到来源?」的问题。

  • 多模型选择。 Tabbit 可以把同一个任务路由给多个模型并排展示答案,当你拿不准哪个模型对你的主题推理得更好时很有用。

  • 从研究到交付物。 因为智能体控制着浏览器,它能把结果直接写进网页表格或文档,而不是只返回纯文本。

Tabbit Agent Mode 正在向 Google Sheets 填入结构化数据,侧边栏可见执行步骤
Agent Mode 能在展示每一步的同时,把研究发现写进在线表格。

代价也很清楚。让 Tabbit 灵活的这套浏览器自动化,同样意味着它默认读不到你的 Microsoft 365 邮件、Teams 聊天或 SharePoint 文档,除非你刻意把这些页面作为上下文分享。如果你的研究依赖内部工作内容,Gemini 或 Microsoft 365 Copilot Researcher 是更整合的选择。如果你的研究主要是基于网页或个人文档,Tabbit 让来源页面紧挨着答案,且无需跳跃到订阅方案。关于更完整的工作流,我们的最佳实践指南介绍了如何从 Agent Mode 中获得更多,研究者概览深度研究浏览器页面则更详细地描述了产品。选套餐前请查看当前的 Tabbit 定价

什么时候该用智能体深度研究,什么时候不该

你的任务最适合的方案原因
快速、带引用的市场快照Perplexity Deep Research最快,导出简单
深度、推理密集的书面报告ChatGPT Deep Research最长推理轨迹,显式推理摘要
与 Google Workspace 文件混合的研究Gemini Deep Research原生访问 Drive、Gmail、Docs
生活在打开标签页里、最终产出交付物的研究Tabbit 浏览器 Agent Mode浏览器层执行,来源可见
读取内部数据的企业研究Microsoft 365 Copilot Researcher通过 Microsoft Graph 授权访问工作数据
单个事实查询普通搜索或一轮对话不需要循环;深度研究是大材小用

表格最后一行很重要:如果一次搜索就能回答问题,再跑几十次只会浪费时间和 token。智能体深度研究适合范围较广、涉及多个来源并且需要综合判断的问题,这时循环的成本才有意义。

需要留意的局限

学术来源很明确地写出了智能体推理的局限,使用者也该正视这些问题。

  • 幻觉不会消失。 工具能让模型更好地依据外部信息作答,但 LLM 仍可能以高置信度陈述错误内容。ReAct 论文的初衷之一是减少「只推理」带来的幻觉,而非彻底消除。实践中也有记录:一位资深开发者在 Hacker News 上写道,LLM 最糟的地方在于「simply being wrong, and then doubling down on it」。另一位讲解推理循环的实践者把「fabricated observations」,也就是「the agent imagines a response that it never actually got」,列为常见陷阱,需要内置的批判步骤来拦截。

  • 更多调用意味着更高成本和延迟。 循环的每一步都是一次模型调用。深度研究在设计上就比一轮对话更慢、更贵;免费档受限正是这个原因。

  • 来源质量仍由你把关。 工具读的是公开网页上的内容。过时页面、营销文案和低质素材都可能混入综合,除非工具做了过滤。

  • 私有和付费数据受限。 除非你上传文件或接入授权数据源,否则这些系统看不到内部文档或订阅研究。

  • 核实仍是人的工作。 引用帮你核查,但不保证准确。对任何高风险说法,去读原始来源。

把任何智能体深度研究工具的输出当作一份带引用的初稿。它让你比从零开始更快地拿到一份结构化简报,但最终判断仍在你。

最终结论

智能体推理是一套机制,不是某个产品。LLM 在循环中规划、调用工具、观察结果,再继续推理。工具调用让模型可以行动,推理循环负责决定如何行动;深度研究则把同一个循环用在大量来源上,最终生成带引用的报告。ChatGPT、Gemini、Perplexity 和浏览器智能体的区别主要在产品实现:运行多久、能访问什么,以及在哪里展示来源。

如果你主要使用聊天工具,并且需要较深的推理,ChatGPT Deep Research 是一个自然的起点。如果研究工作大多发生在浏览器里,Tabbit 浏览器值得一试。你可以免费下载 macOS 或 Windows 版,运行研究任务时让来源页面一直留在眼前。产品功能会调整档位,甚至下线。微软把 Copilot Deep Research 移到订阅背后就是一例,详情可参阅我们对 Copilot Deep Research 下线的记录。相比具体产品,本文介绍的机制更不容易过时。

常见问题

什么是 AI 中的智能体推理?

智能体推理指大模型能够自行决定下一步做什么——规划一步、调用一个工具、读取结果,然后继续推理——而不是一次性作答。2025 年 ACL 的一篇论文把它形式化为「通过集成外部工具型智能体(如网络搜索、代码执行、结构化记忆)来增强 LLM 推理」的框架。

LLM 是怎么使用工具的?

通过工具调用(也叫函数调用)。应用向模型提供可用工具列表及其输入格式;当模型需要外部信息时,它不再输出自然语言猜测,而是发出一个结构化调用,由应用执行该工具,再把结果回传给模型继续推理。正是这一机制把聊天模型变成了能行动的模型。

推理和工具使用有什么区别?

推理是模型逐步思考一个问题的过程;工具使用是模型在真实世界中采取行动,例如发起搜索或执行代码。两者是不同能力,但智能体推理把它们结合起来:模型先推理该做什么,再用工具去做,观察结果,然后再推理。

智能体推理如何驱动深度研究?

深度研究会把智能体循环运行很多次。智能体规划子问题、搜索网页、阅读并对比来源、根据新信息更新计划,最后写出带引用的报告。正是这个「规划—行动—观察—推理」的循环,让深度研究能处理单个搜索无法覆盖的宽泛问题。

像 Tabbit 这样的浏览器能做智能体深度研究吗?

可以。Tabbit 浏览器的 Agent Mode 能够规划搜索、打开页面并生成结构化报告,同时保留来源标签页可见。它最适合公开网页与个人文档类研究,而不是锁在 Microsoft 365 等套件内的企业数据。

智能体推理型 LLM 有哪些局限?

它们仍会产生幻觉,调用次数比单轮对话多、成本更高,并且可能以高置信度给出错误答案。公开网页上的来源质量参差不齐,所以输出应被视为带引用的初稿,需要人来核实。

下一步

让 Tabbit 与你并肩工作。

跨标签页调研、自动化重复的浏览器工作,让每一处上下文都触手可及。