TabbitBlog

エージェント的推論:LLMがツールを使ってディープリサーチを行う仕組み

エージェント的推論によって、LLMは計画し、ツールを呼び、ループの中で推論を続けられるようになる。これはDeep Researchの背後にあるエンジンだ。本記事では、その仕組み、ツールがどう組み込まれるか、そしてTabbitがこのループをブラウザの中でどう実現するかを説明する。

この記事の内容
  1. 主要なポイント
  2. エージェント的推論とは何か?
  3. 推論からツール使用へ:LLMはどうやってツールを呼ぶのか
  4. 推論ループ:計画 → 行動 → 観察 → 推論
  5. このループがどうディープリサーチになるか
  6. ディープリサーチのアプローチ比較
  7. ブラウザレベルの実用的な選択肢:Tabbit Deep Research
  8. エージェント的ディープリサーチが効くとき、そうでないとき
  9. 心に留めておくべき限界
  10. 最終的な結論

2025年のACL論文『Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools』は、この概念を正確に定義しています。「外部のツール使用型エージェントを統合することで、大規模言語モデルの推論を強化する」フレームワークだと。平たく言えば、モデルは一度きりで答えるのをやめ、計画を立て、ツールを呼び出し、結果を読み取り、ループの中で推論を続けるようになります。

しかし、その力には実際のユーザーがただちに直面する落とし穴があります。ある Hacker News のコメント投稿者が、自分が最もよく知るテーマ——自分自身——について OpenAI Deep Research を走らせたところ、500語のレポートに3つの事実誤りを見つけました。それでも彼は「decent enough for a springboard」と呼び、ただし「treat the output with caution and follow the links provided」ことが条件だとしました。この緊張関係——有能でありながら、それでも確認を要するツール——こそが、まさに推論ループが生み出すものであり、本記事全体を貫いています。

このループこそが、すべての「Deep Research」機能の背後にあるエンジンです。OpenAIやGeminiからPerplexity、さらにはブラウザレベルのエージェントに至るまで、同じ仕組みが動いています。Deep Researchツールに幅広い質問を投げると、同じサイクルを数十回繰り返し、引用付きのレポートを返してくれます。本記事では、これらのピースがどう繋がるのかを説明します。エージェント的推論とは何か、LLMはどうやってツールを呼ぶのか、推論ループはどんな形をしているのか、そしてそのループがどうDeep Researchになるのか。記事の終わり近くでは、Tabbitブラウザのようなブラウザレベルのツールが、同じループをあなたがすでに仕事をしている場所にどう持ち込むかを示します。

主要なポイント

  • エージェント的推論とは、推論にツールが加わり、ループになること。 モデルは一段階を計画し、アクション(検索、コード実行、メモリ検索)をとり、結果を観察し、再び推論します。1ターンで答えるのではありません。

  • ツール呼び出しが接点。 推論とツール使用は異なる能力ですが、エージェント的推論は両者を組み合わせ、モデルに「考え、行動する」ことを可能にします。

  • Deep Researchはこのループのスケール版。 同じ「計画—行動—観察—推論」サイクルを多くの情報源に対して繰り返すことで、チャットモデルがリサーチエージェントに変わります。

  • 仕組みは共通、パッケージが異なる。 ChatGPT、Gemini、Perplexity、そしてTabbitのようなブラウザエージェントは、すべてこのループの一変種を動かしています。違いは実行時間、情報源へのアクセス、そして仕事がどこで起きるかにあります。

  • 出力は引用付きの初稿であり、結論ではない。 ツールが読むのは公開ウェブで、ハルシネーションも起きるし、モデル呼び出しのコストもかかります。重要な事柄は、最終的に人が検証する必要があります。

エージェント的推論とは何か?

一番シンプルに言えば、エージェント的推論とは、大規模言語モデルが自分で次の一歩を決めることです。目標が与えられると、それをサブタスクに分解し、ツールを選び、実行し、結果を見て、目標が達成されるまで進み続けます。対極にあるのは、1ターンで終わるチャットボットです。プロンプトを送ると、モデルが自身の重みと限られたコンテキストに基づいて答え、やり取りはそこで終わります。

用語の定義は情報源によって多少異なりますが、輪郭は一致しています。

  • 上記のarXiv論文は、外部のツール使用型エージェントを統合することで推論を強化するものとして定義しています。具体的には、ウェブ検索、コード実行、そして論理関係を追うための構造化ナレッジグラフを構築する「マインドマップ」エージェントです。

  • IBMは、エージェント的推論をAIエージェントが自律的に行動できるようにする意思決定コンポーネントとして説明しています。

  • NVIDIAは、エージェント型AIにおける「推論、計画、行動」の基礎ブロックとして位置づけています。

これがエージェント的と呼ばれるゆえんは、「小さな自律性」にあります。モデルが何時間も無監督で動くという意味ではなく、あるタスクの中で、次のアクションを自分で選ぶ——固定のスクリプトに従うのではない——という意味です。より広い背景を知りたければ、エージェントブラウザとはの解説で、この考えがブラウザにどう適用されるかを取り上げています。

推論からツール使用へ:LLMはどうやってツールを呼ぶのか

モデルが自分で推論するには、訓練済みの重みとこれまでの対話があれば足ります。行動するには、ツールが必要です。ここでツール呼び出し——別名関数呼び出し——が登場します。

仕組みはシンプルです。アプリケーションはモデルに利用可能なツールのリストと、それぞれがどんな入力を受け取るかを伝えます。モデルが外部の情報を必要とすると判断したとき、自然言語の推測を書くのではなく、構造化された呼び出しを発行します(例:「この検索クエリを実行して」「このコードを実行して」)。アプリケーションがそのツールを実行し、結果を返します。モデルは結果を読み、処理を続けます。

プロダクションレベルの例を二つ挙げます。

  • OpenAIの関数呼び出しは、モデルが構造化された関数リクエストを発行し、アプリケーションが実行して返す仕組みです。

  • Anthropicのツール使用も同じパターンに従います。モデルがツールを要求し、クライアントが実行し、その観察結果が対話にフィードバックされます。

このやり取りが重要なのは、世界を語るモデルと世界を読むモデルを分ける境界線だからです。チャットモデルなら「最新の数値はたぶんXくらいでしょう」と言うかもしれません。ツールを使えるモデルは、検索を実行し、実際のページを読み、そのページに基づいて答えられます。精度の向上は、答えをモデルの訓練記憶ではなく、鮮度の高い外部証拠に根付かせることから生まれます。

推論ループ:計画 → 行動 → 観察 → 推論

ツール呼び出しはモデルに手を与えます。推論ループは、その手をどう使うかを教えます。もっとも明快な説明は、Yaoらが2022年に発表したReAct(Reason + Act)で、3種類のステップを交互に繰り返します。

  1. 思考(推論)。 モデルは現在地と次に何をすべきかを推論します。

  2. 行動。 ツールを呼びます——検索、コード実行、メモリ検索。

  3. 観察。 ツールが返した結果を読みます。

そして再び推論します。現実のタスクが「思考—行動—観察」の1セットで済むことはなく、長い連鎖になります。モデルは計画し、行動し、観察し、計画を変えるような新しいことを学び、続けていきます。論文の重要な発見は、推論と行動を交互に挟むことが、どちらか単独より優るということでした。推論だけのモデルは自信に満ちたハルシネーションに陥りやすく、行動だけのモデルは良い行動を選ぶための計画力を欠きます。

現代のエージェントシステムはこれを四つの繰り返しに圧縮します。

  • 計画 —— 目標を次のサブステップに分解する。

  • 行動 —— 適切なツールを呼ぶ。

  • 観察 —— 結果を読む。

  • 推論 —— 計画を更新し、次に何をすべきか決める。

arXivの『Agentic Reasoning』フレームワークは、このループの上に構造を加えます。ウェブ検索エージェント、コード実行エージェント、そして学んだことをナレッジグラフとして記録するマインドマップエージェントで、長い連鎖の中で脈絡を失わないようにします。DeepSeek-R1にデプロイした結果、公開モデルの中でSOTAを達成し、OpenAI Deep Researchに匹敵すると報告しています。ここから覚えておくべきは、特定のスコアではなく、「ループと適切なツールの組み合わせこそが深い結果を生む」という事実です。

このループがどうディープリサーチになるか

Deep Researchとは、1回の検索には広すぎる問題に、推論ループを適用したものです。同じ「計画—行動—観察—推論」サイクルが、多くの情報源をまたいで数十回繰り返される様子を想像してみてください。

  1. リサーチを計画する。 エージェントは質問を読み、サブクエスチョンを特定し、検索計画を組み立てます。競合状況を頼めば、市場ポジション、価格、機能、最近のニュースに分割するかもしれません。

  2. 検索し、行動する。 多くのクエリを走らせ、ページを開き、学びながら計画を更新します。「行動」と「観察」が繰り返されます。

  3. 情報源をまたいで推論する。 主張を比較し、矛盾にフラグを立て、関連性の低い素材を除外します。統合はここで起きるのであって、断片を並べるだけではありません。

  4. 引用付きで報告する。 各主張を検証できるよう、情報源へ戻るリンクを付けた構造化ドキュメントを書きます。

これが、Deep Researchが秒ではなく分単位で時間がかかる理由です。OpenAI Deep Researchは実行時間5〜30分、Perplexity Deep Researchは通常2〜4分で完了します。この差はマーケティングではなく、ループが何回走るか、検索の間にどれだけ推論が挟まるかを反映しています。速い実行は安価ですが浅く、長い実行はより推論しますがコストも高く、それでも間違えることはあります。

同じトレードオフは、どのツールにも現れます。ループが見えると、「Deep Research」は神秘的な機能ではなくなり、3つのエンジニアリングの選択の問題になります。何回ループするのか、どんなツールに手が届くのか、そして情報源をどこで見るのか。

ディープリサーチのアプローチ比較

アプローチ推論スタイルツールアクセス情報源の可視性最適な用途
ChatGPT Deep Research長く推論の密度が高い軌跡(5〜30分)ウェブ検索、MCP連携チャット内の推論サマリーと引用深く推論の効いた書面レポート
Gemini Deep Research計画してからリサーチ、Workspaceコンテンツも任意でウェブ、Google Docs / Drive / Gmail構造化された計画と引用付き結果Google Workspaceのファイルと組み合わせたリサーチ
Perplexity Deep Research高速な反復検索(2〜4分)ウェブ、タスクごとに数十回の検索インライン引用、PDF / Pageエクスポートエクスポートできる、引用付きの素早いスナップショット
Tabbitブラウザ(Agent Mode)ブラウザレベルのループ、ステップが見えるライブなブラウザ:ページ、タブ、ファイル情報源のタブが答えの隣に開いたまま開いたタブの中で生き、最終的に成果物に行き着くリサーチ

実行時間と利用枠は頻繁に変わります。スナップショットとして扱い、選択前に各ツールの最新ページを確認してください。

ブラウザレベルの実用的な選択肢:Tabbit Deep Research

すべてのリサーチタスクが、チャットウィンドウやオフィススイーツのサブスクリプションの背後に属するわけではありません。もし仕事がすでにブラウザの中で進んでいるなら——記事を読み、製品ページを比較し、スプレッドシートを埋めるような作業をしているなら——ブラウザレベルのAIブラウザが、あなたのいる場所で推論ループを動かせます。それがTabbitの発想です。

Tabbitブラウザは、ブラウザウィンドウの中でAgent Modeを動かします。リサーチタスクに対し、あなたが望む成果を記述すると、Tabbitが検索を計画し、関連ページを開き、内容を観察し、構造化レポートを組み立てます。上で説明した「計画—行動—観察—推論」サイクルと同じものを、ツール面をブラウザそのものにして動かします。

TabbitブラウザがAgentサイドバーでDeep Researchタスクを実行し、Googleの検索結果と実行ステップが表示されている様子
TabbitのDeep Researchワークフローは、各実行ステップを表示し、検証用に情報源ページを開いたままにします。

ブラウザレベルならではの違いは次のとおりです。

  • @ references で渡すブラウザコンテキスト。 コンテキストをコピペする代わりに、開いているタブ、タブグループ、スクリーンショット、ブックマーク、ローカルファイルをタスクに添付できます。エージェントはあなたがいま見ているものを対象に推論します。

  • 情報源が見えたまま。 元のページが答えの隣に開いたままなので、主張の確認は長いレポートをスクロールするのではなく、ひと目で済みます。これは前節の「情報源をどこで見るのか」という問いに直接答えるものです。

  • マルチモデル選択。 Tabbitは同じタスクを複数モデルに振り分け、答えを並べて表示できます。自分のテーマをどのモデルが一番うまく推論するか確信がないときに有用です。

  • リサーチから成果物へ。 エージェントがブラウザを操作するため、結果をプレーンテキストで返すのではなく、ウェブ上のスプレッドシートやドキュメントに直接書き込めます。

TabbitのAgent ModeがGoogle Sheetsに構造化データを入力し、サイドバーに実行ステップが表示されている様子
Agent Modeは、各ステップを表示しながら、リサーチで得た発見をライブスプレッドシートに書き込めます。

トレードオフも明確です。Tabbitを柔軟にするブラウザ自動化は、同時に、あなたが意図的にそのページをコンテキストとして共有しない限り、Microsoft 365のメール、Teamsのチャット、SharePointの文書を読めないことを意味します。リサーチが社内の作業内容に依存するなら、GeminiやMicrosoft 365 Copilot Researcherのほうが統合されています。リサーチが主にウェブベースあるいは個人文書ベースなら、Tabbitはサブスクリプションの壁を設けず、情報源ページを答えのすぐ隣に置いてくれます。より広いワークフローについては、ベストプラクティスガイドがAgent Modeからさらに引き出す方法を紹介し、リサーチャー向け概要ディープリサーチブラウザのページが製品をより詳しく説明しています。プランを選ぶ前に、最新のTabbitの料金を確認してください。

エージェント的ディープリサーチが効くとき、そうでないとき

あなたのタスク最適なアプローチ理由
引用付きの素早い市場スナップショットPerplexity Deep Research最速の実行時間、簡単なエクスポート
深く推論の効いた書面レポートChatGPT Deep Research最も長い推論軌跡、明示的な推論サマリー
Google Workspaceのファイルと組み合わせたリサーチGemini Deep ResearchDrive、Gmail、Docsへのネイティブアクセス
開いたタブの中で生き、成果物に行き着くリサーチTabbitブラウザ Agent Modeブラウザレベルの実行、情報源が見える
社内データを読む企業リサーチMicrosoft 365 Copilot ResearcherMicrosoft Graph経由の認証付きアクセス
単一の事実確認通常の検索か1ターンのチャットループは不要。Deep Researchは過剰です

最後の行が、ぜひ覚えておきたい一行です。エージェント的ディープリサーチが価値を持つのは、まさにループがコストのかかる処理だからです。1回の検索で答えられる質問に、数十回のループを回すのは時間とトークンの無駄です。ループがそのコストに見合うのは、質問が広範で、複数の情報源を持ち、統合によって恩恵を受けるときだけです。

心に留めておくべき限界

エージェント的推論は強力ですが、学術情報源はその限界について率直であり、利用者も同様であるべきです。

  • ハルシネーションは消えない。 ツールはモデルの接地を良くしますが、LLMは依然として誤った内容を自信たっぷりに述べることがあります。ReAct論文の動機の一つは、推論のみのハルシネーションを減らすことであり、なくすことではありません。この失敗は実際の現場でもよく記録されています。Hacker News で経験豊かな開発者は、LLMの最悪の部分は「simply being wrong, and then doubling down on it」だと書きました。また、推論ループを解説する実践者は、「fabricated observations」——すなわち「the agent imagines a response that it never actually got」——を、組み込みの批判ステップが捕捉すべき標準的な落とし穴として挙げています。

  • 呼び出しが増えればコストも遅延も増す。 ループの各ステップが1回のモデル呼び出しです。Deep Researchは設計上、チャットの1ターンより遅く、コストがかかります。無料枠が制限されているのはまさにそのためです。

  • 情報源の品質はあなたの責任のまま。 ツールが読むのは、公開ウェブにあるものすべてです。古いページ、マーケティング文案、低品質なコンテンツが、ツールがフィルタしない限り統合に入り込みます。

  • 非公開および有料のデータには制限がある。 ファイルをアップロードしたり、認証済みデータソースに接続したりしない限り、これらのシステムは社内文書やサブスクリプションリサーチを見られません。

  • 検証は依然として人の仕事。 引用はチェックを助けますが、正確さを保証しません。重要度の高い主張については、一次情報源を自分で読んでください。

どんなエージェント的ディープリサーチツールの出力も、引用付きの初稿として扱ってください。ゼロから始めるより早く構造化されたブリーフにたどり着けますが、最終的な判断はあなたにあります。

最終的な結論

エージェント的推論は、製品ではなく仕組みとして理解するのがいちばんいいでしょう。計画し、ツールを呼び、結果を観察し、ループの中で推論するLLMのことです。ツール呼び出しがモデルに手を与え、推論ループがその使い方を教え、Deep Researchはその同じループが多くの情報源をまたいで走り、引用付きレポートが出てくるまで続きます。この連鎖がひとたび明確になれば、ChatGPT、Gemini、Perplexity、そしてブラウザエージェントの違いは、パッケージの違い——ループの長さ、手の届く範囲、情報源を見る場所——であって、異なる思想の違いではなくなります。

もしあなたがすでにチャット系ツールに住んでいて、もっとも深い推論を欲しているなら、ChatGPT Deep Researchが自然な出発点です。もしあなたのリサーチがブラウザの中にあって、エージェントにあなたの働く場所で働いてほしいなら、Tabbitブラウザは試す価値があります。macOSまたはWindows版を無料でダウンロードし、情報源ページを見えたままにして、最初のリサーチタスクを走らせてみてください。そして、機能はティアを移動したり提供を終えたりするものです——MicrosoftがCopilot Deep Researchをサブスクリプションの背後に移したのを見たように(Copilot Deep Researchの提供終了の記録を参照)——ので、本記事で説明した仕組みこそが、個別のプロダクトが変わったずっとあとまで覚えておく価値のある部分なのです。

よくある質問

AIにおけるエージェント的推論とは何ですか?

エージェント的推論とは、大規模言語モデルが自ら次に何をすべきかを決めることを指します。一段階を計画し、ツールを呼び、結果を読み、推論を続けるのであって、1ターンで答えるのではありません。2025年のACL論文は、ウェブ検索、コード実行、構造化メモリといった外部のツール使用型エージェントを統合することでLLMの推論を強化するフレームワークとして、これを定式化しました。

LLMはどうやってツールを使うのですか?

ツール呼び出し(関数呼び出しとも呼ばれます)を通じて行います。アプリケーションが利用可能なツールのリストと入力形式をモデルに渡します。モデルは外部情報が必要になったとき、平文の推測ではなく構造化された呼び出しを発行し、アプリケーションがそのツールを実行して、結果をモデルにフィードバックして続けさせます。これが、チャットモデルを行動できるものに変える仕組みです。

推論とツール使用の違いは何ですか?

推論は、モデルが問題を一段階ずつ考えていくことです。ツール使用は、モデルが現実世界でアクションをとることで、たとえば検索を走らせたりコードを実行したりすることを指します。これらは別の能力ですが、エージェント的推論は両者を組み合わせます。モデルは何をすべきかを推論し、ツールを使ってそれを行い、結果を観察し、もう一度推論します。

エージェント的推論はどうディープリサーチを動かすのですか?

Deep Researchは、エージェントのループを何度も走らせます。エージェントはサブクエスチョンを計画し、ウェブを検索し、情報源を読んで比較し、学びながら計画を更新し、引用付きのレポートを書き上げます。エージェント的推論を定義する「計画—行動—観察—推論」のサイクルこそが、1回の検索には広すぎる問いをDeep Researchに扱わせるものです。

Tabbitのようなブラウザでエージェント的ディープリサーチはできますか?

はい。TabbitブラウザはAgent Modeを備え、検索を計画し、ページを開き、情報源のタブを見えたままにしながら構造化レポートを構築します。Microsoft 365のようなスイートの中に閉じ込められた企業データよりも、公開ウェブや個人文書のリサーチに向いています。

エージェント的推論型LLMの限界は何ですか?

ハルシネーションは依然として起きます。モデル呼び出しの回数が多く、1ターンのチャットよりコストがかかります。高い確信度で間違えることもあります。公開ウェブ上の情報源の品質はばらつくため、出力は人が検証すべき引用付きの初稿として扱うべきです。

次のステップへ

Tabbit と一緒に仕事をしましょう。

タブをまたいで調査し、繰り返しのブラウザ作業を自動化し、あらゆる文脈を手の届くところに。