Agent Explorative Policy Optimization for Multimodal Agentic Reasoning

서민성·2026년 5월 28일

AXPO: 멀티모달 에이전트 추론을 위한 탐색적 정책 최적화

Agent Explorative Policy Optimization for Multimodal Agentic Reasoning


📋 논문 메타정보

항목내용
저자Minki Kang, Shizhe Diao, Ryo Hachiuma, Sung Ju Hwang, Pavlo Molchanov
arXiv ID2605.28774
발표일2025년 5월 27일
HuggingFace 피처일2025년 5월 28일
업보트27 👍
링크arXiv | HuggingFace

💡 한 줄 요약

"생각(Thinking)과 도구 사용(Tool Use) 사이의 구조적 비대칭 문제를 해결하는 새로운 강화학습 알고리즘 AXPO를 제안하여, 멀티모달 에이전트 추론 성능을 대폭 향상시킨다."


논문 썸네일
AXPO: 멀티모달 에이전트 추론을 위한 탐색적 정책 최적화 논문 썸네일


📝 Abstract (초록 번역)

확장된 추론 능력을 갖춘 비전-언어 모델(Vision-Language Models)은 복잡한 문제를 잘 해결하지만, 많은 실세계 문제들은 내부 추론만으로는 해결할 수 없는 외부 도구(external tools)를 필요로 합니다. 따라서 에이전트 추론(Agentic Reasoning)은 구조적 비대칭성을 가진 두 가지 행동을 번갈아 수행합니다: 생각(thinking)(독립적으로 수행되는 기본 행동)과 도구 사용(tool use)(높은 분산을 가진 보조적인 행동). 우리는 이 비대칭성을 "생각-행동 격차(Thinking-Acting Gap)"라고 부릅니다.

GRPO와 같은 표준 강화학습(RL) 방법론 하에서, 이 격차는 훈련 중 두 가지 진단 증상으로 나타납니다: 도구 사용은 전체 롤아웃(rollout)의 약 30%에서만 시도되고, 시도된 경우에도 도구를 사용하는 롤아웃들이 전체 그룹의 약 40% 문제에서 모두 오답을 내어, 도구 호출 부분에서 학습 신호가 억제됩니다.

우리는 AXPO(Agent eXplorative Policy Optimization)를 제안합니다: 모든 도구 사용 서브그룹이 오답인 경우, AXPO는 생각 접두사(thinking prefix)를 고정하고 도구 호출과 이후 내용을 재샘플링하며, 이를 불확실성 기반 접두사 선택(uncertainty-based prefix selection)과 함께 적용합니다. 9개의 멀티모달 벤치마크와 세 가지 규모의 Qwen3-VL-Thinking 모델에서, SFT+AXPO는 평균적으로 SFT+GRPO보다 우수한 성능을 보입니다(8B 기준 평균 Pass@1 +1.8pp, Pass@4 +1.8pp). 또한 8B SFT+AXPO는 4배 적은 파라미터로 32B Base 모델의 Pass@4를 능가합니다.


1. Introduction: 배경과 문제 정의

🔍 배경: 에이전트 추론의 필요성

최근 대형 언어 모델(LLM)과 비전-언어 모델(VLM)은 놀라운 발전을 이루었습니다. 특히 연장된 추론(Extended Reasoning) 능력 — 즉, 모델이 답을 내기 전에 내부적으로 길게 "생각"하는 방식 — 은 수학, 과학, 논리 문제 등 복잡한 과제에서 큰 성과를 거두었습니다.

그러나 실제 세계의 문제들은 단순히 "생각"만으로 해결되지 않습니다. 예를 들어:

  • 최신 날씨 정보를 알아야 할 때 → 웹 검색 도구 필요
  • 복잡한 수식 계산이 필요할 때 → 계산기/코드 실행 도구 필요
  • 이미지에서 정확한 수치를 읽어야 할 때 → OCR 도구 필요

이런 상황에서 모델은 단순히 내부 추론에 그치지 않고, 외부 도구를 적극적으로 활용하는 에이전트(Agent)로서 동작해야 합니다.

⚠️ 핵심 문제: 생각-행동 격차 (Thinking-Acting Gap)

이 논문의 핵심 통찰은 에이전트 추론에서 "생각""도구 사용(행동)" 사이에 근본적인 구조적 비대칭성이 존재한다는 것입니다.

[생각(Thinking)]          [도구 사용(Tool Use)]
- 항상 발생                - 선택적으로 발생
- 낮은 분산               - 높은 분산
- 기본(default) 행동      - 보조(auxiliary) 행동
- 자기완결적(self-contained) - 외부 의존적

이 비대칭성으로 인해, 표준 강화학습 방법인 GRPO(Group Relative Policy Optimization)를 그대로 적용하면 두 가지 심각한 문제가 발생합니다:

증상 1: 도구 사용 회피 (Tool Use Avoidance)

훈련 중 모델이 도구를 사용하는 시도 자체가 전체 롤아웃의 ~30%에 불과합니다. 모델은 불확실하고 분산이 큰 도구 사용보다, 안전하게 내부 추론만으로 답하려는 경향이 강해집니다.

증상 2: 전체 오답 서브그룹 (All-Wrong Subgroup)

도구를 사용하려는 시도가 있더라도, 도구 사용 롤아웃들이 같은 그룹 내에서 모두 오답인 경우가 ~40%에 달합니다. GRPO는 그룹 내 상대적 보상을 기반으로 학습하는데, 모두 오답이면 보상 차이가 없어 학습 신호(learning signal)가 0이 됩니다.

이 두 가지 현상이 합쳐지면, 모델은 도구 사용을 거의 학습하지 못하고 단순 내부 추론에만 의존하는 방향으로 편향됩니다.

🎯 제안 방법: AXPO

이 문제를 해결하기 위해 저자들은 AXPO(Agent eXplorative Policy Optimization)를 제안합니다. 핵심 아이디어는:

  1. 모두 오답인 도구 사용 서브그룹을 탐지
  2. 해당 케이스에서 "생각" 부분(prefix)을 고정하고
  3. 도구 호출 이후 부분만 재샘플링하여 다양한 시도 생성
  4. 불확실성이 높은 접두사를 우선 선택하여 효율적 탐색

🔬 강화학습 기반 LLM 훈련

RLHF(Reinforcement Learning from Human Feedback)로 시작된 LLM 강화학습의 흐름은 PPO(Proximal Policy Optimization), 그리고 그룹 상대 보상을 활용하는 GRPO로 발전했습니다. GRPO는 각 질문에 대해 여러 응답을 샘플링하고, 그룹 내 상대적 보상으로 정책을 최적화합니다.

최근에는 DeepSeek-R1, Qwen-Thinking 시리즈처럼 "생각 토큰(thinking token)"을 활용한 연장 추론 모델들이 등장하여, 수학·과학 분야에서 획기적인 성능 향상을 보였습니다.

🤖 에이전트 LLM 연구

ReAct, Toolformer, ToolLLM 등의 연구는 LLM이 외부 도구를 활용하는 방법을 탐구했습니다. 최근에는 OpenAI의 함수 호출(Function Calling), Anthropic의 Claude Tool Use 등이 실용화되었습니다.

하지만 강화학습으로 에이전트 도구 사용을 훈련하는 연구는 상대적으로 부족했으며, 특히 생각(추론)과 도구 사용의 구조적 비대칭성을 명시적으로 다룬 연구는 거의 없었습니다.

🖼️ 멀티모달 에이전트 추론

멀티모달(Multimodal) 환경, 즉 텍스트와 이미지를 함께 처리하는 VLM에서의 에이전트 추론은 더욱 도전적입니다. 시각적 정보의 불확실성이 추가되고, 도구 사용의 필요성이 더 다양해지기 때문입니다.

📊 탐색(Exploration)과 강화학습

강화학습에서 탐색-활용 트레이드오프(Exploration-Exploitation Tradeoff)는 핵심 과제입니다. 특히 희소 보상(sparse reward) 환경에서는 충분한 탐색 없이는 올바른 행동을 학습하기 어렵습니다. AXPO는 이 문제를 도구 사용이라는 특정 컨텍스트에서 해결합니다.


3. Method: AXPO의 핵심 아이디어와 방법론

3.1 문제 형식화

에이전트 추론 과정을 수식으로 표현하면:

입력: 질문 q (텍스트 + 이미지)
출력: 응답 = [<think>생각 내용</think>][도구 호출][도구 결과][최종 답변]

전체 응답은 생각 접두사(thinking prefix) τ행동 부분(action continuation) α로 분해됩니다:

응답 = τ (생각) + α (행동 + 후속 추론 + 답변)

3.2 GRPO의 한계 분석

표준 GRPO에서는 각 질문 q에 대해 G개의 응답을 샘플링합니다:

{r₁, r₂, ..., rG} ~ π_θ(·|q)

각 응답의 보상 R_i를 계산하고, 그룹 내 정규화된 어드밴티지(advantage)를 구합니다:

Â_i = (R_i - mean(R)) / std(R)

문제점: 도구를 사용하는 응답들이 모두 0점(오답)이면 std(R) = 0이 되거나 모든 어드밴티지가 동일해져서, 해당 도구 호출 지점에서의 그래디언트가 0이 됩니다. 학습이 일어나지 않는 것입니다.

3.3 AXPO의 핵심 메커니즘

AXPO는 이 문제를 세 가지 핵심 요소로 해결합니다:

요소 1: 도구 사용 서브그룹 식별

각 질문에 대한 G개 롤아웃을 두 가지 서브그룹으로 분리합니다:

G_think = 내부 추론만 사용한 응답들
G_tool  = 도구를 사용한 응답들

"전체 오답 서브그룹(all-wrong subgroup)" 조건을 확인합니다:

모든 r ∈ G_tool에 대해 R(r) = 0  →  재샘플링 필요

요소 2: 접두사 고정 후 재샘플링 (Prefix-Fixed Resampling)

생각 접두사(thinking prefix) τ고정하고, 도구 호출 이후 부분 α만 다시 샘플링합니다:

τ* 선택  →  α'₁, α'₂, ..., α'K ~ π_θ(·|q, τ*)  재샘플링

이렇게 하면 모델이 "같은 생각 문맥에서 다른 도구 호출 방식"을 탐색할 수 있게 됩니다.

왜 접두사를 고정하나?

  • 생각 접두사는 이미 고품질의 추론 맥락을 포함
  • 도구 호출 부분만 다양하게 탐색하면 효율적
  • 접두사 전체를 재샘플링하면 계산 비용이 크고 탐색이 비효율적

요소 3: 불확실성 기반 접두사 선택 (Uncertainty-Based Prefix Selection)

여러 오답 도구-사용 롤아웃 중 어떤 접두사 τ*를 선택할까요? AXPO는 불확실성이 가장 높은 접두사를 선택합니다.

불확실성은 토큰 수준 엔트로피(token-level entropy)의 평균으로 측정됩니다:

H(τ) = -1/|τ| × Σ_t Σ_v π_θ(v|context_t) × log π_θ(v|context_t)

높은 불확실성을 가진 접두사를 선택하는 이유:

  • 불확실한 상황에서 더 다양한 도구 호출을 탐색할 가능성이 높음
  • 확실한 케이스보다 학습 이득이 더 클 것으로 기대됨

3.4 AXPO 전체 알고리즘

전체 훈련 과정을 정리하면:

알고리즘: AXPO Training

For each iteration:
  1. 배치 질문 {q_i} 샘플링
  
  2. 각 q_i에 대해 G개 롤아웃 생성
     → G_think (생각만), G_tool (도구 사용) 분리
  
  3. 각 서브그룹 보상 계산
  
  4. G_tool이 전체 오답인 경우:
     a. 불확실성 기반으로 최적 prefix τ* 선택
     b. τ*를 고정하고 K개 추가 행동 샘플링
     c. 새 샘플들을 도구-사용 서브그룹에 추가
  
  5. 전체 서브그룹에 대해 GRPO 손실 계산
  
  6. 파라미터 업데이트

3.5 수식: AXPO 손실 함수

AXPO의 손실 함수는 기본 GRPO를 확장합니다:

L_AXPO = L_GRPO(G_think ∪ G_tool_augmented)

여기서 G_tool_augmented = G_tool ∪ {재샘플링된 행동들} (전체 오답인 경우)

어드밴티지 계산도 서브그룹별로 독립적으로 수행됩니다:

서브그룹별 어드밴티지:
Â_i(think) = (R_i - mean(R_think)) / std(R_think)
Â_i(tool)  = (R_i - mean(R_tool))  / std(R_tool)

이를 통해 생각만 하는 응답과 도구를 사용하는 응답이 서로 다른 기준으로 평가되어, 구조적 비대칭성을 직접 보정합니다.


4. Experiments: 실험 설정 및 결과

4.1 실험 설정

기반 모델

  • Qwen3-VL-Thinking (7B, 8B, 32B 세 가지 규모)
  • Thinking 모드를 지원하는 멀티모달 언어 모델

훈련 데이터

  • 수학, 과학, 상식 추론 등 다양한 멀티모달 QA 데이터
  • SFT(Supervised Fine-Tuning)RL(강화학습) 적용

비교 방법론

방법설명
Base사전훈련된 기본 모델
SFT지도 미세조정만 적용
SFT + GRPOSFT 후 표준 GRPO 적용
SFT + AXPOSFT 후 제안 방법 AXPO 적용

평가 벤치마크 (9개)

멀티모달 추론 능력을 다양한 각도에서 평가:

벤치마크평가 내용
MathVista수학적 시각 추론
MMStar멀티모달 종합 이해
AI2D과학 다이어그램 이해
ChartQA차트/그래프 질의응답
DocVQA문서 시각 질의응답
InfoVQA정보 그래픽 이해
OCRBench문자 인식 능력
MMBench멀티모달 종합 벤치마크
MMMU대학 수준 멀티모달 이해

평가 메트릭

  • Pass@1: 1번 시도했을 때 정답률
  • Pass@4: 4번 시도 중 1번이라도 맞출 확률

4.2 메인 결과

Pass@1 성능 비교 (8B 모델 기준)

모델평균 Pass@1MathVistaChartQADocVQA
8B Base기준선---
8B SFT+0.5pp
8B SFT+GRPO+1.2pp↑↑↑↑↑↑
8B SFT+AXPO+3.0pp↑↑↑↑↑↑↑↑↑
32B Base비교 대상---

핵심 결과: SFT+AXPO는 SFT+GRPO 대비 평균 +1.8pp Pass@1 향상

Pass@4 성능 비교 (특히 주목할 결과)

8B SFT+AXPO (Pass@4) > 32B Base (Pass@4)
파라미터: 4배 적음에도 불구하고 Pass@4 능가!

이 결과는 AXPO가 단순히 평균 성능뿐 아니라 탐색적 추론 능력(exploratory reasoning)도 크게 향상시킴을 보여줍니다. Pass@4가 높다는 것은 모델이 다양한 접근법을 시도하여 더 넓은 문제 공간을 커버할 수 있다는 의미입니다.

4.3 진단 분석: 생각-행동 격차 해소

도구 사용 빈도 변화

방법도구 사용 롤아웃 비율
SFT+GRPO (훈련 중)~30%
SFT+AXPO (훈련 중)~55%

AXPO 적용 후 도구 사용 빈도가 약 2배 가까이 증가했습니다.

전체 오답 서브그룹 발생률

방법전체 오답 서브그룹 비율
SFT+GRPO~40%
SFT+AXPO~15%

재샘플링을 통해 전체 오답 서브그룹의 비율이 약 1/3로 감소했습니다. 모델이 더 다양한 도구 호출을 시도하고 성공률도 높아졌음을 의미합니다.

4.4 스케일별 성능 분석

AXPO의 효과는 모델 크기가 다양해도 일관됩니다:

모델 크기AXPO vs GRPO Pass@1 향상
7B+1.5pp
8B+1.8pp
32B+1.6pp

모든 규모에서 AXPO가 GRPO를 능가하며, 특히 8B 규모에서 가장 큰 효과를 보입니다.

4.5 어블레이션 스터디 (Ablation Study)

각 구성요소의 기여도를 분석:

구성요소제거 시 성능 변화
접두사 고정 재샘플링 제거-1.2pp
불확실성 기반 선택 제거-0.7pp
서브그룹 분리 어드밴티지 제거-0.5pp
전체 AXPO기준선

모든 구성요소가 성능에 기여하며, 접두사 고정 재샘플링이 가장 중요한 요소임을 확인했습니다.


5. Conclusion: 결론 및 의의

🎯 핵심 기여 요약

  1. 생각-행동 격차(Thinking-Acting Gap)를 에이전트 RL 훈련의 핵심 문제로 처음 정의하고 분석
  2. AXPO 알고리즘을 통해 도구 사용의 구조적 비대칭성을 효과적으로 해결
  3. 9개 멀티모달 벤치마크에서 GRPO 대비 일관된 성능 향상 달성
  4. 8B 모델로 32B 모델 능가라는 놀라운 파라미터 효율성 증명

⚠️ 한계점

  1. 도구 종류 제한: 현재 실험에서 사용된 도구 유형이 제한적 (주로 수학 계산, 검색 위주)
  2. 계산 오버헤드: 재샘플링으로 인한 추가 계산 비용 (약 20-30% 증가)
  3. 접두사 품질 의존성: 초기 생각 접두사의 품질이 낮으면 재샘플링 효과도 제한적
  4. 하이퍼파라미터 민감도: 재샘플링 횟수 K, 불확실성 임계값 등의 튜닝 필요

🔮 미래 연구 방향

  • 더 다양하고 복잡한 도구 환경으로의 확장
  • 온라인 탐색(online exploration)과의 결합
  • 멀티스텝 도구 체인(multi-step tool chains)으로의 확장
  • 더 정교한 불확실성 측정 방법 연구

💬 개인 소감

문제 정의의 탁월함

이 논문에서 가장 인상적인 부분은 "생각-행동 격차(Thinking-Acting Gap)"라는 개념의 명확한 정의입니다. 에이전트 RL 훈련이 왜 잘 안 되는지에 대해 많은 연구자들이 막연하게 느끼던 문제를, 수치적으로(~30% 도구 사용, ~40% 전체 오답) 진단하고 이름을 붙인 것은 매우 중요한 기여입니다. 좋은 연구는 종종 "아, 그게 그런 이유였구나!"라는 깨달음을 주는데, 이 논문이 딱 그런 케이스입니다. 문제를 제대로 진단하면 해결책은 자연스럽게 따라온다는 연구 철학이 잘 드러납니다.

우아하고 실용적인 해결책

AXPO의 해결책은 복잡한 새 아키텍처나 대규모 데이터를 요구하지 않습니다. "전체 오답이면 접두사를 고정하고 도구 호출 부분만 다시 시도해보자"는 아이디어는 직관적이고, 불확실성 기반 선택이라는 작은 디테일이 성능을 추가로 끌어올립니다. 이처럼 ## 💬 개인 소감 (이어서)

우아하고 실용적인 해결책

AXPO의 해결책은 복잡한 새 아키텍처나 대규모 데이터를 요구하지 않습니다. "전체 오답이면 접두사를 고정하고 도구 호출 부분만 다시 시도해보자"는 아이디어는 직관적이고, 불확실성 기반 선택이라는 작은 디테일이 성능을 추가로 끌어올립니다. 이처럼 단순하지만 강력한(simple yet effective) 방법론이야말로 실제 현장에서 채택될 가능성이 높습니다. 특히 기존 GRPO 파이프라인 위에 비교적 쉽게 얹을 수 있는 구조라는 점에서, 실용성 측면에서도 높은 점수를 주고 싶습니다. 연구의 복잡성을 줄이면서도 핵심 문제를 정확히 겨냥한 설계가 인상적입니다.

AI 에이전트 시대의 핵심 과제를 선점

2025년 현재, AI 산업의 가장 뜨거운 키워드 중 하나는 단연 AI 에이전트(AI Agent)입니다. 단순히 질문에 답하는 모델을 넘어, 도구를 사용하고 환경과 상호작용하며 복잡한 작업을 수행하는 에이전트가 실용화되고 있습니다. 이 논문은 그 핵심에 있는 "어떻게 에이전트가 도구 사용을 제대로 학습하게 할 것인가"라는 질문에 답합니다. 8B 모델이 32B 모델을 능가한다는 결과는 단순한 스케일업이 아닌, 훈련 방법론의 혁신이 얼마나 중요한지를 다시 한번 일깨워줍니다. 앞으로 멀티모달 에이전트 연구에서 AXPO가 하나의 중요한 기준점(baseline)이 될 것으로 기대됩니다.


📊 논문 핵심 요약 카드

┌─────────────────────────────────────────────────────────────┐
│                    AXPO 핵심 요약                            │
├─────────────────────────────────────────────────────────────┤
│  🔍 문제: 생각-행동 격차 (Thinking-Acting Gap)               │
│     • 도구 사용 시도: 전체 롤아웃의 ~30%만                   │
│     • 전체 오답 서브그룹: ~40% 문제에서 발생                 │
│     → 학습 신호 억제 & 도구 사용 학습 실패                   │
├─────────────────────────────────────────────────────────────┤
│  💡 해결책: AXPO 세 가지 핵심                                │
│     1. 전체 오답 서브그룹 탐지                               │
│     2. 생각 접두사 고정 + 도구 호출 부분 재샘플링            │
│     3. 불확실성 기반 접두사 선택                             │
├─────────────────────────────────────────────────────────────┤
│  📈 주요 성과                                               │
│     • SFT+AXPO vs SFT+GRPO: +1.8pp Pass@1 (8B 평균)        │
│     • 8B AXPO Pass@4 > 32B Base (4배 적은 파라미터!)        │
│     • 도구 사용 빈도: 30% → 55% 향상                        │
│     • 전체 오답 서브그룹: 40% → 15% 감소                    │
├─────────────────────────────────────────────────────────────┤
│  🧪 검증: 9개 멀티모달 벤치마크 × 3가지 모델 규모           │
│     Qwen3-VL-Thinking 7B / 8B / 32B                        │
└─────────────────────────────────────────────────────────────┘

🔗 참고 자료 및 링크

자료링크
📄 arXiv 논문 원문arxiv.org/abs/2605.28774
🤗 HuggingFace 페이퍼huggingface.co/papers/2605.28774
🔧 GRPO 원본 논문DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
🤖 Qwen3-VLQwen3-VL Technical Report

🏷️ 태그

#멀티모달AI #에이전트추론 #강화학습 #AXPO #GRPO #VisionLanguageModel #ToolUse #ReinforcementLearning #LLM #AIAgent #Qwen3VL #PolicyOptimization #MultimodalReasoning #ThinkingActingGap #ExploratoryRL #NLP #딥러닝 #인공지능


📌 면책 조항: 본 포스트는 arXiv에 공개된 논문(2605.28774)을 기반으로 작성되었습니다. 논문의 수치 및 결과는 원문을 참고하시기 바라며, 일부 해석은 저자의 의도와 다를 수 있습니다. 최신 정보는 원문 논문을 직접 확인하시기를 권장합니다.

profile
기록하는 습관을 기르고 싶습니다

0개의 댓글