TabbitBlog

에이전트 추론: LLM이 도구를 사용해 딥 리서치를 수행하는 방법

에이전트 추론은 LLM이 계획을 세우고, 도구를 호출하며, 루프 안에서 계속 추론하게 만드는 메커니즘입니다. 딥 리서치의 엔진이 바로 이것입니다. 작동 원리, 도구가 어떻게 결합되는지, 그리고 Tabbit가 이 루프를 브라우저로 가져온 방법을 정리합니다.

이 글의 목차
  1. 핵심 요약
  2. 에이전트 추론이란 무엇인가?
  3. 추론에서 도구 사용으로: LLM은 도구를 어떻게 호출하나
  4. 추론 루프: 계획 → 행동 → 관찰 → 추론
  5. 이 루프가 딥 리서치가 되는 과정
  6. 딥 리서치 접근 방식 비교
  7. 브라우저 수준의 실용적 선택: Tabbit Deep Research
  8. 에이전트 딥 리서치가 도움이 될 때와 그렇지 않을 때
  9. 새겨둘 한계
  10. 최종 결론

2025년 ACL 논문 《Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools》는 이 개념을 정확히 잡아냈습니다. '외부 도구 사용 에이전트를 통합해 대형 언어 모델의 추론을 강화하는' 프레임워크라는 정의입니다. 쉽게 말해, 모델이 한 번에 답을 내놓는 대신 계획을 세우고, 도구를 호출하고, 결과를 읽고, 루프 안에서 계속 추론하기 시작합니다.

그 힘에는 실사용자가 금방 부딪히는 함정이 있습니다. 한 Hacker News 댓글 작성자가 자신이 가장 잘 아는 주제, 즉 자기 자신을 대상으로 OpenAI Deep Research를 돌렸을 때, 그는 500단어짜리 보고서에서 세 곳의 사실 오류를 잡아냈습니다. 그럼에도 그는 "treat the output with caution and follow the links provided"라는 조건 아래 "decent enough for a springboard"라고 평했습니다. 능력은 있되 여전히 확인이 필요한 도구, 이런 긴장이 바로 추론 루프가 만들어내는 것이며 이 글 전체를 관통합니다.

이 루프는 곧 모든 '딥 리서치' 기능의 엔진이기도 합니다. OpenAI와 Gemini부터 Perplexity, 브라우저 수준의 에이전트까지 모두 같은 주기를 수십 번 돌린 뒤 인용된 보고서를 돌려줍니다. 이 글은 이 조각들이 어떻게 연결되는지를 설명합니다. 에이전트 추론이 무엇인지, LLM이 도구를 어떻게 호출하는지, 추론 루프가 어떤 모양인지, 그리고 그 루프가 어떻게 딥 리서치가 되는지. 글의 후반부에서는 Tabbit 브라우저 같은 브라우저 수준 도구가 같은 루프를 당신이 이미 일하는 자리로 가져오는 지점을 보여줍니다.

핵심 요약

  • 에이전트 추론 = 추론 + 도구, 그리고 루프. 모델이 한 단계를 계획하고, 행동(검색·코드·메모리 조회)을 취하고, 결과를 관찰한 뒤 다시 추론합니다. 한 번에 답하지 않습니다.

  • 도구 호출이 경첩입니다. 추론과 도구 사용은 서로 다른 능력입니다. 에이전트 추론은 둘을 결합해 모델이 생각하고 행동하게 만듭니다.

  • 딥 리서치는 루프를 규모 있게 실행한 결과입니다. 같은 '계획-행동-관찰-추론' 주기가 많은 출처에 걸쳐 반복되면서 대화 모델을 리서치 에이전트로 바꿉니다.

  • 메커니즘은 같고, 포장은 다릅니다. ChatGPT, Gemini, Perplexity, Tabbit 같은 브라우저 에이전트는 모두 이 루프의 한 버전을 돌립니다. 차이는 소요 시간, 출처 접근 범위, 작업이 일어나는 위치에 있습니다.

  • 결과물은 인용된 초안이지 결론이 아닙니다. 도구는 공개 웹을 읽고, 환각이 발생할 수 있으며, 모델 호출 수도 늘어납니다. 중요한 내용은 사람이 검증해야 합니다.

에이전트 추론이란 무엇인가?

가장 단순히 말해, 에이전트 추론은 대형 언어 모델이 자신의 다음 단계를 스스로 결정하는 상태입니다. 목표가 주어지면 그 목표를 하위 작업으로 쪼개고, 도구를 고르고, 실행하고, 돌아온 결과를 살피며, 목표를 달성할 때까지 계속 진행합니다. 반대편에는 단일 턴 챗봇이 있습니다. 프롬프트를 보내면 모델이 자신의 가중치와 제한된 컨텍스트로 답을 내놓고 대화가 끝납니다.

용어의 정의는 출처마다 조금씩 다르지만, 윤곽은 일치합니다.

  • 앞선 arXiv 논문은 '외부 도구 사용 에이전트 통합을 통한 추론 강화'로 정의합니다. 웹 검색, 코드 실행, 그리고 배운 내용을 구조화된 지식 그래프로 정리해 논리적 관계를 추적하는 '마인드맵' 에이전트가 그 구성 요소입니다.

  • IBM은 에이전트 추론을 AI 에이전트가 자율적으로 행동하도록 만드는 의사결정 구성 요소로 설명합니다.

  • NVIDIA는 이를 에이전트 AI의 '추론·계획·행동' 기본 빌딩 블록으로 봅니다.

이것이 에이전트적이라 불리는 이유는 '작은 단위의 자율성' 때문입니다. 모델이 몇 시간 동안 감시 없이 돌아간다는 뜻이 아닙니다. 하나의 작업 안에서 다음 행동을 고정된 스크립트가 아니라 스스로 선택한다는 의미입니다. 더 넓은 맥락이 궁금하다면 에이전트 브라우저란 해설에서 이 아이디어가 브라우저로 어떻게 옮겨오는지 다룹니다.

추론에서 도구 사용으로: LLM은 도구를 어떻게 호출하나

모델이 스스로 추론하려면 학습된 가중치와 지금까지의 대화만 있으면 됩니다. 하지만 행동하려면 도구가 필요합니다. 여기서 도구 호출(함수 호출이라고도 함)이 등장합니다.

메커니즘은 단순합니다. 애플리케이션이 사용 가능한 도구 목록과 각 도구가 받는 입력 형식을 모델에 알려줍니다. 모델이 외부 정보가 필요하다고 판단하면 자연어 추측을 쓰지 않고 구조화된 호출(예: "이 검색어를 실행", "이 코드를 실행")을 내보냅니다. 애플리케이션이 도구를 실행하고 결과를 돌려주면, 모델은 그 결과를 읽고 이어갑니다.

운영 환경의 두 사례:

  • OpenAI 함수 호출은 모델이 구조화된 함수 요청을 내보내고 애플리케이션이 이를 실행해 되돌려주는 방식입니다.

  • Anthropic 도구 사용도 같은 패턴입니다. 모델이 도구를 요청하면 클라이언트가 이를 실행하고 관찰 결과를 대화에 다시 밀어 넣습니다.

이 주고받기가 중요한 이유는, 세상에 대해 말하는 모델과 세상을 읽는 모델을 구분해 주기 때문입니다. 대화 모델은 "최신 수치는 대략 X일 것이다"라고 말할 수 있습니다. 반면 도구를 쓰는 모델은 검색을 실행하고 실제 페이지를 읽고 그 페이지에서 답합니다. 정확도의 향상은 모델의 학습 기억이 아니라 신선한 외부 증거에 답을 고정하기에서 옵니다.

추론 루프: 계획 → 행동 → 관찰 → 추론

도구 호출은 모델에게 손을 줍니다. 추론 루프는 그 손을 어떻게 쓸지 알려줍니다. 가장 명확한 설명은 Yao 등이 2022년 발표한 ReAct(Reason + Act)로, 세 종류의 단계를 번갈아 배치합니다.

  1. 사고(추론). 모델이 지금 어디에 있고 다음에 무엇을 해야 할지 추론합니다.

  2. 행동. 도구를 호출합니다. 검색, 코드 실행, 메모리 조회가 될 수 있습니다.

  3. 관찰. 도구의 결과를 읽습니다.

그리고 다시 추론합니다. 현실의 작업은 사고-행동-관찰 한 조각으로 끝나지 않고 그 연결이 길게 이어집니다. 모델이 계획하고, 행동하고, 관찰하고, 계획을 바꿀 새로운 사실을 배우고, 이어 나갑니다. 논문의 핵심 발견은 추론과 행동을 번갈는 것이 어느 하나만 쓰는 것보다 낫다는 점이었습니다. 추론만 하는 모델은 자신만만한 환각으로 흘러가기 쉽고, 행동만 하는 모델은 좋은 행동을 고를 계획 능력이 부족합니다.

현대의 에이전트 시스템은 이것을 네 가지 반복 동작으로 압축합니다.

  • 계획 —— 목표를 다음 하위 단계로 쪼갭니다.

  • 행동 —— 알맞은 도구를 호출합니다.

  • 관찰 —— 결과를 읽습니다.

  • 추론 —— 계획을 갱신하고 다음을 결정합니다.

arXiv의 《Agentic Reasoning》 프레임워크는 이 루프 위에 구조를 얹습니다. 웹 검색 에이전트, 코드 실행 에이전트, 그리고 배운 내용을 지식 그래프로 유지해 긴 사슬이 맥락을 잃지 않게 하는 마인드맵 에이전트입니다. DeepSeek-R1에 올려 작동시킨 결과, 저자들은 공개 모델 사이에서 SOTA 결과를 보고하며 OpenAI Deep Research와 견줄 만하다고 밝혔습니다. 기억할 점은 특정 점수가 아니라 '루프와 알맞은 도구'가 깊이 있는 결과를 만든다는 사실입니다.

이 루프가 딥 리서치가 되는 과정

딥 리서치는 한 번의 검색으로는 감당하기 어려운 넓은 질문에 추론 루프를 적용한 것입니다. 같은 '계획-행동-관찰-추론' 주기가 많은 출처에 걸쳐 수십 번 도는 모습을 떠올려 보세요.

  1. 리서치 계획. 에이전트가 질문을 읽고 하위 질문을 식별한 뒤 검색 계획을 짭니다. 경쟁 구도를 요청하면 시장 위치, 가격, 기능, 최근 소식으로 작업을 나눌 수 있습니다.

  2. 검색과 행동. 여러 쿼리를 실행하고 페이지를 열며, 배우는 대로 계획을 갱신합니다. '행동'과 '관찰'이 반복됩니다.

  3. 출처 간 추론. 주장을 비교하고 충돌을 표시하며 관련성이 낮은 자료를 거릅니다. 단편을 나열하는 게 아니라 종합이 일어나는 지점입니다.

  4. 인용 보고서. 각 주장을 소스로 되돌아갈 수 있게 링크를 단 구조화 문서를 씁니다.

이것이 딥 리서치가 몇 초가 아니라 몇 분 걸리는 이유입니다. OpenAI Deep Research는 530분의 실행 시간을 보고하고, Perplexity Deep Research는 보통 24분 안에 끝납니다. 차이는 마케팅이 아닙니다. 루프가 몇 번 도는지, 검색 사이에 얼마나 많은 추론이 일어나는지를 반영합니다. 빠른 실행은 더 싸지만 얕고, 긴 실행은 추론은 많지만 비용이 더 들고 여전히 틀릴 수 있습니다.

같은 트레이드오프가 모든 도구에 나타납니다. 루프가 보이기 시작하면 '딥 리서치'는 신비로운 기능이 아니라 세 가지 엔지니어링 선택의 문제가 됩니다. 루프를 몇 번 도는가, 어떤 도구에 닿을 수 있는가, 출처를 어디서 보는가?

딥 리서치 접근 방식 비교

방식추론 스타일도구 접근출처 가시성가장 적합한 경우
ChatGPT Deep Research길고 추론 집약적인 흐름(5~30분)웹 검색, MCP 통합대화창 안의 추론 요약과 인용깊고 추론 집약적인 서면 보고서
Gemini Deep Research먼저 계획 후 리서치, Workspace 콘텐츠 선택웹 + Google Docs / Drive / Gmail구조화된 계획과 인용 결과Google Workspace 파일과 섞인 리서치
Perplexity Deep Research빠른 반복 검색(2~4분)웹, 작업당 수십 건의 검색인라인 인용, PDF / Page 내보내기내보낼 수 있는 빠른 인용 스냅샷
Tabbit 브라우저(Agent Mode)브라우저 수준 루프, 단계가 보임살아 있는 브라우저: 페이지, 탭, 파일출처 탭이 답 옆에 열린 채로 유지열린 탭에 살면서 산출물로 끝나는 리서치

실행 시간과 할당량은 자주 바뀝니다. 이 표는 스냅샷으로 보고, 확정하기 전에 각 도구의 현재 페이지를 확인하세요.

브라우저 수준의 실용적 선택: Tabbit Deep Research

모든 리서치 작업이 채팅창에 들어가거나 생산성 제품군 구독 뒤에 묶여야 하는 건 아닙니다. 당신의 일이 이미 브라우저에서 이뤄진다면(기사 읽기, 제품 페이지 비교, 스프레드시트 채우기), 브라우저 수준의 AI 브라우저가 추론 루프를 당신이 이미 있는 자리에서 돌릴 수 있습니다. 이것이 Tabbit의 출발점입니다.

Tabbit 브라우저는 브라우저 창 안에서 Agent Mode를 구동합니다. 리서치 작업에 대해 결과를 설명하면, Tabbit가 검색을 계획하고 관련 페이지를 열며, 내용을 관찰하고 구조화된 보고서를 조립합니다. 앞서 설명한 '계획-행동-관찰-추론' 주기를 그대로 돌리되, 도구 표면이 브라우저 자체입니다.

Tabbit 브라우저의 Agent 사이드바에서 Deep Research 작업이 실행 중이고 Google 검색 결과와 실행 단계가 보이는 모습
Tabbit의 Deep Research 워크플로는 각 실행 단계를 보여 주고, 출처 페이지를 검증용으로 열어 둡니다.

브라우저 수준 버전이 다른 점:

  • @ references와 브라우저 컨텍스트. 컨텍스트를 복사-붙여넣기하는 대신 열려 있는 탭, 탭 그룹, 스크린샷, 북마크, 로컬 파일을 작업에 첨부할 수 있습니다. 에이전트는 당신이 이미 보고 있는 것을 기반으로 추론합니다.

  • 출처가 계속 보입니다. 원본 페이지가 답 옆에 열려 있어, 주장을 확인하려면 긴 보고서를 뒤지는 게 아니라 눈길 한 번이면 충분합니다. 앞 절의 '출처를 어디서 보는가?' 질문에 대한 직접적인 답입니다.

  • 다중 모델 선택. Tabbit는 같은 작업을 여러 모델에 라우팅해 답을 나란히 보여 줄 수 있습니다. 어떤 모델이 당신의 주제에 더 낫게 추론하는지 불확실할 때 유용합니다.

  • 리서치에서 산출물로. 에이전트가 브라우저를 제어하기 때문에, 결과를 일반 텍스트로 돌려주는 대신 웹 스프레드시트나 문서에 바로 넣을 수 있습니다.

Tabbit Agent Mode가 Google Sheets에 구조화된 데이터를 입력하고 사이드바에 실행 단계가 보이는 모습
Agent Mode는 각 단계를 보여 주면서 리서치 결과를 살아 있는 스프레드시트로 옮길 수 있습니다.

트레이드오프도 분명합니다. Tabbit를 유연하게 만드는 브라우저 자동화는, 당신이 의도적으로 해당 페이지를 컨텍스트로 공유하지 않는 한 Microsoft 365 이메일, Teams 채팅, SharePoint 문서를 기본적으로 읽지 못한다는 뜻이기도 합니다. 리서치가 내부 업무 콘텐츠에 의존한다면 Gemini나 Microsoft 365 Copilot Researcher가 더 통합된 선택입니다. 반면 리서치가 주로 웹 기반이거나 개인 문서 기반이라면, Tabbit는 구독 단계를 바꾸지 않고도 출처 페이지를 답 옆에 둡니다. 더 넓은 워크플로는 모범 사례 가이드가 Agent Mode에서 더 많은 것을 끌어내는 법을 다루고, 리서처 개요딥 리서치 브라우저 페이지가 제품을 더 자세히 설명합니다. 플랜을 고르기 전에 현재 Tabbit 가격을 확인하세요.

에이전트 딥 리서치가 도움이 될 때와 그렇지 않을 때

작업가장 적합한 방식이유
빠르고 인용된 시장 스냅샷Perplexity Deep Research가장 빠른 실행, 단순한 내보내기
깊고 추론 집약적인 서면 보고서ChatGPT Deep Research가장 긴 추론 흐름, 명시적 추론 요약
Google Workspace 파일과 섞인 리서치Gemini Deep ResearchDrive, Gmail, Docs에 대한 기본 접근
열린 탭에 살면서 산출물로 끝나는 리서치Tabbit 브라우저 Agent Mode브라우저 수준 실행, 출처가 보임
내부 데이터를 읽는 기업 리서치Microsoft 365 Copilot ResearcherMicrosoft Graph를 통한 업무 데이터 접근 권한
단일 사실 조회일반 검색 또는 한 턴의 대화루프 불필요, 딥 리서치는 과합니다

마지막 줄이 기억할 만합니다. 에이전트 딥 리서치가 가치 있는 건 정확히 루프가 비싸기 때문입니다. 한 번의 검색으로 답이 되는 질문이라면, 수십 번을 도는 건 시간과 토큰 낭비입니다. 루프는 질문이 넓고, 출처가 여럿이며, 종합이 도움이 될 때 비용을 갚습니다.

새겨둘 한계

에이전트 추론은 강력하지만, 학술 출처는 그 한계를 솔직히 인정합니다. 사용자도 마찬가지여야 합니다.

  • 환각은 사라지지 않습니다. 도구가 모델을 더 잘 접지하지만, LLM은 여전히 거짓을 높은 확신으로 말할 수 있습니다. ReAct 논문의 동기 중 하나는 추론만 할 때의 환각을 줄이는 것이었지, 제거하는 것은 아니었습니다. 이런 실패는 현장에서도 잘 기록되어 있습니다. Hacker News에서 한 경험 많은 개발자는 LLM에서 가장 나쁜 점이 "simply being wrong, and then doubling down on it"라고 썼고, 추론 루프를 해설한 한 실무자는 "fabricated observations" — 즉 "the agent imagines a response that it never actually got" — 를 기본 내장된 비평 단계가 잡아내야 할 표준적 함정으로 꼽았습니다.

  • 호출이 많으면 비용과 지연도 커집니다. 루프의 매 단계가 모델 호출입니다. 딥 리서치는 설계상 한 턴의 대화보다 느리고 비쌉니다. 무료 등급이 제한되는 이유가 바로 이것입니다.

  • 출처 품질은 여전히 당신 몫입니다. 도구는 공개 웹에 있는 것은 무엇이든 읽습니다. 오래된 페이지, 마케팅 문구, 저품질 콘텐츠가 도구가 걸러내지 않으면 종합에 섞여 들 수 있습니다.

  • 비공개·유료 데이터는 제한됩니다. 파일을 업로드하거나 인증된 데이터 소스를 연결하지 않으면, 이 시스템은 내부 문서나 구독 리서치를 볼 수 없습니다.

  • 검증은 여전히 사람의 일입니다. 인용은 확인을 돕지만 정확성을 보증하지 않습니다. 중요도가 높은 주장이라면 1차 출처를 직접 읽으세요.

어떤 에이전트 딥 리서치 도구의 결과물이든 인용이 달린 초안으로 대하십시오. 0에서 시작하는 것보다 구조화된 요약에 더 빨리 도달하게 해 주지만, 최종 판단은 당신의 몫입니다.

최종 결론

에이전트 추론은 메커니즘으로 이해하는 것이 가장 좋습니다. 제품이 아니라 하나의 메커니즘입니다. 계획하고, 도구를 호출하고, 결과를 관찰하고, 루프 안에서 추론하는 LLM. 도구 호출은 모델에게 손을, 추론 루프는 그 쓰임을 알려 주고, 딥 리서치는 같은 루프가 많은 출처 위에서 인용 보고서가 나올 때까지 도는 것입니다. 이 사슬이 명확해지면 ChatGPT, Gemini, Perplexity, 브라우저 에이전트 사이의 차이는 패키징의 차이가 됩니다. 얼마나 오래 도는가, 무엇에 닿을 수 있는가, 출처를 어디서 보는가. 다른 아이디어가 아니라 그런 차이입니다.

이미 채팅 기반 도구에서 일하고 있고 가장 깊은 추론이 필요하다면, ChatGPT Deep Research가 자연스러운 출발점입니다. 리서치가 브라우저에서 이뤄지고 에이전트가 당신이 일하는 자리에서 일하길 원한다면, Tabbit 브라우저가 테스트해 볼 만합니다. macOS 또는 Windows용을 무료로 다운로드하고, 출처 페이지를 보이는 상태로 첫 리서치 작업을 돌려 보세요. 그리고 기능은 등급이 바뀌거나 사라질 수 있습니다. Microsoft가 Copilot Deep Research를 구독 뒤로 옮겼을 때 우리가 본 것처럼요. Copilot Deep Research 종료에 대한 정리를 함께 참고하시면, 이 글이 전하는 메커니즘이 어떤 단일 제품의 변화 이후에도 오래 기억할 만한 부분이라는 걸 알 수 있습니다.

자주 묻는 질문

AI에서 에이전트 추론이란 무엇인가요?

에이전트 추론은 대형 언어 모델이 다음 단계를 스스로 결정하는 상태를 가리킵니다. 한 단계를 계획하고, 도구를 호출하고, 결과를 읽고, 다시 추론을 이어가는 식입니다. 2025년 ACL 논문은 이를 '웹 검색, 코드 실행, 구조화된 메모리 같은 외부 도구 사용 에이전트를 통합해 LLM 추론을 강화하는 프레임워크'로 정식화했습니다.

LLM은 어떻게 도구를 사용하나요?

도구 호출(함수 호출이라고도 함)을 통합니다. 애플리케이션이 사용 가능한 도구 목록과 각 도구의 입력 형식을 모델에 알려줍니다. 모델이 외부 정보가 필요해지면 자연어로 된 추측 대신 구조화된 호출을 내보내고, 애플리케이션이 그 도구를 실행한 뒤 결과를 다시 모델에 돌려줍니다. 이 메커니즘이 대화 모델을 행동할 수 있는 모델로 바꿉니다.

추론과 도구 사용의 차이는 무엇인가요?

추론은 모델이 문제를 단계별로 생각하는 과정이고, 도구 사용은 모델이 실제 세계에서 행동을 취하는 것(예: 검색 실행, 코드 실행)입니다. 둘은 다른 능력이지만, 에이전트 추론은 이를 결합합니다. 모델이 무엇을 해야 할지 추론하고, 도구로 실행하며, 결과를 관찰하고, 다시 추론합니다.

에이전트 추론은 딥 리서치를 어떻게 구동하나요?

딥 리서치는 에이전트 루프를 여러 번 반복합니다. 에이전트가 하위 질문을 계획하고, 웹을 검색하며, 출처를 읽고 비교하고, 알게 된 것에 따라 계획을 갱신한 뒤 인용이 포함된 보고서를 씁니다. 에이전트 추론을 정의하는 '계획-행동-관찰-추론' 주기가 딥 리서치가 단일 검색으로는 감당할 수 없는 넓은 질문을 처리하게 만듭니다.

Tabbit 같은 브라우저도 에이전트 딥 리서치를 할 수 있나요?

네. Tabbit 브라우저의 Agent Mode가 검색을 계획하고, 페이지를 열며, 구조화된 보고서를 만듭니다. 이 과정에서 출처 탭이 그대로 보이도록 유지합니다. Microsoft 365 같은 생산성 제품군 안에 묶인 기업 데이터보다는 공개 웹과 개인 문서 연구에 더 적합합니다.

에이전트 추론형 LLM의 한계는 무엇인가요?

여전히 환각을 일으키고, 단일 대화 턴보다 모델 호출이 많아 비용이 더 들며, 높은 확신으로 틀린 답을 내놓기도 합니다. 공개 웹의 출처 품질이 들쭉날쭉하므로, 결과물은 인용이 달린 초안으로 보고 사람이 확인하는 것이 원칙입니다.

다음 단계

Tabbit 과 함께 일하세요.

탭 간 조사를 하고, 반복적인 브라우저 작업을 자동화하며, 모든 맥락을 손이 닿는 곳에 두세요.