V-Thinker: Interactive Thinking with Images

lit·2025년 11월 7일

느낀점

  • 코드를 생성해서 이미지 상호작용하려는 모습 참신함
  • 시각 인식 후에 상호작용 들어가는 모습이 인간의 사고 방식과 비슷
  • 루프가 복잡해서 추론 속도가 그리 빠를 느낌이 아님
  • 데이터 만드는 비용 궁금
  • 코드 직접 생성하고 테스트 하는 부분이 무한 루프를 돌기 쉬운 구조 같음

Abstract

LMM이 이미지 상호작용과 장기적인 추론 능력을 통합하도록 하는 것은 오랜 과제로 남아있습니다.
최근 비전 중심 추론의 발전은 LMM을 위한 "이미지로 생각하기"라는 유망한 패러다임을 탐구하며 이미지 보조 추론에서 이미지 상호작용적 사고로 크게 전환하고 있습니다.
이러한 성과는 모델이 세분화된 이미지 영역에 집중할 수 있게 해주었지만 여전히 좁은 시각적 도구 공간과 특정 작업에 한정된 워크플로우 설계로 인해 발전이 제한되고 있습니다.

이러한 격차를 해소하기 위해 end to end 강화 학습을 통해 상호작용적이고 비전 중심적인 사고를 가능하게 하는 범용 멀티모달 추론 보조 시스템인 V-Thinker를 제시합니다.
V-Thinker는 두 가지 핵심 구성 요소로 이루어집니다:
(1) 다양성, 품질, 난이도라는 세 가지 차원에 걸쳐 상호작용 추론 데이터셋을 자동으로 합성, 발전, 검증하는 데이터 진화 플라이휠(Data Evolution Flywheel); (2) 먼저 포인트 레벨 감독(point-level supervision)을 통해 인식을 정렬한 다음, 2단계 강화 학습 프레임워크를 통해 상호작용 추론을 통합하는 시각적 점진적 학습 커리큘럼(Visual Progressive Training Curriculum).

비전 중심의 상호작용 추론 작업을 목표로 하는 전문가 검증 벤치마크인 VTBench를 소개합니다.
광범위한 실험을 통해 V-Thinker가 일반 및 상호작용 추론 시나리오 모두에서 강력한 LMM 기반 베이스라인을 일관되게 능가함을 입증했으며이미지 상호작용 추론 애플리케이션을 발전시키는 데 통찰력을 제공합니다.

Introduction

문제점
기존의 대형 시각 언어 모델은 긴 텍스트를 생성할 수는 있지만 실제 이미지의 시각적 근거에서 벗어나 언어적 패턴에 의존하여 환각(hallucination)을 일으키는 경우가 많습니다.

해결책
V-Thinker는 이미지와 자율적으로 상호작용(예: 코드 생성을 통한 이미지 편집)하며 문제를 해결하는 범용 멀티모달 추론 보조 모델입니다.
end to end 강화 학습(RL)을 통해 훈련되었습니다.

핵심 구성 요소
논문은 V-Thinker를 구현하기 위한 두 가지 핵심 요소를 제안합니다.

  1. Data Evolution Flywheel
  • 고품질의 학습 데이터를 자동으로 생성, 검증, 발전시키는 시스템입니다.
  • 다양성, 품질, 난이도의 3가지 차원을 관리하여 V-Interaction-400K라는 대규모 상호작용 데이터셋을 구축했습니다.
  1. Visual Progressive Training Curriculum
    모델을 2단계로 나누어 점진적으로 훈련시킵니다.
  • 1단계 (인식 정렬): 모델이 이미지 내 객체의 위치를 정확히 파악하도록 훈련합니다. (이를 위해 V-Perception-40K 데이터셋도 별도 구축)
  • 2단계 (상호작용 추론 정렬): 강화 학습을 통해, 모델이 시각적 근거에 기반하여 추론을 유지하면서 이미지와 상호작용하는 코드를 생성하도록 훈련합니다.

기여

  • V-Thinker 모델 및 새로운 훈련 패러다임 제시
  • 대규모 고품질 데이터셋 2종 (V-Interaction-400K, V-Perception-40K) 공개
  • 모델의 상호작용 추론 능력을 평가하기 위한 새로운 벤치마크 VTBench 도입
  • 실험 결과 V-Thinker가 기존 LMM 기반 모델들보다 뛰어난 성능을 보였습니다.

Preliminary

Problem Formulation

V-Thinker: 코드 기반의 상호작용형 추론
'V-Thinker'라는 새로운 비전 중심 추론 패러다임을 제안합니다.
핵심은 모델이 단순히 이미지를 보는 것을 넘어 이미지를 수정하는 코드를 생성하며 적극적으로 상호작용한다는 점입니다.

  • 작동 방식: 모델은 각 추론 단계에서 텍스트로 된 생각(thought)과 함께 이미지를 조작하는 코드(code)를 생성합니다.

  • 시각적 피드백: 이 코드가 실행되어 이미지가 업데이트(예: 특정 부분 하이라이트, 보조선 추가)되면 모델은 이 변경된 시각적 피드백을 바탕으로 다음 단계의 추론을 이어갑니다.

데이터 생성 패러다임의 전환
기존의 학습 데이터는 사람이 만든 문제를 모델이 푸는 방식이었으나 이는 다양성과 확장성에 한계가 있었습니다. 이 연구는 데이터 생성에 대한 두 가지 새로운 방향을 제시합니다.

역할 전환: 'Solver'에서 'Creator'로

GPT-5와 같은 최신 LMM은 복잡한 문제와 이미지를 직접 생성할 능력이 있습니다.

모델들은 고품질의 원본 이미지, 보조 다이어그램, 추론 과정을 생성하는 Python 코드를 직접 생성할 수 있습니다.

모델은 수동적으로 문제를 푸는 대신 능동적으로 복잡하고 혁신적인 문제를 만들어냅니다.

Knowledge-Driven 표현

데이터 생성을 위해 기존의 '예시'를 사용하는 대신 '구조화된 지식 시스템'을 활용합니다.

모델에게 '무엇에 대해' 추론할지(예: 화학 원소)라는 '지식 개념'만 제공하면 모델이 '어떻게' 추론할지(문제, 이미지, 해결 과정)를 상호작용을 통해 스스로 생성해냅니다.

Methodology

데이터가 스스로 생성, 검증, 수정되며 다시 확장되는 '선순환 구조'를 통해 지식 시스템과 도구 시스템을 지속적으로 발전시키는 모델

왼쪽: 지식 기반 진화 메커니즘

Knowledge System : 처음에는 'Knowledge (Init)'으로 시작하지만 프레임워크가 작동하면서 '다중 도메인 지식 시스템'으로 발전합니다.

Generator: 지식 시스템을 기반으로 질문과 답변, 원본 코드, 시각 도구 코드를 생성합니다.

Visual Tool System: 'Tool (Init)'에서 시작해 '도구 시스템'으로 발전합니다. 생성된 코드를 실행하여 시각적 결과물을 만듭니다.

피드백 루프: 이렇게 생성된 결과물은 다시 '지식 시스템'으로 피드백되어 지식을 더욱 풍부하게 확장시킵니다.

가운데

Expansion: 데이터는 'Sequential' 방식(하나의 질문에서 다음 질문으로 이어짐) 또는 '병렬적' 방식(동시에 여러 질문 처리)으로 확장됩니다. (Q: 질문, CoT: 사고의 연쇄, A: 답변)

Checker: 생성된 Q&A와 이미지의 정확성을 검사합니다.

Repairer: '검사기'가 오류(X)로 판단한 부분을 올바르게(O) 수정합니다.

보정 루프: '검사'와 '수리'를 거친 고품질의 데이터는 다시 '확장' 단계의 입력으로 사용되어, 시스템 전체의 품질을 지속적으로 향상시킵니다.

오른쪽

Original_img_code: matplotlib를 사용해 사각뿔을 그리는 코드를 보여줍니다.

Q&A :

Question (질문): "밑면 변의 길이가 10이고 높이가 12인 정사각뿔이 있습니다. 측면 모서리 AB의 길이는 얼마인가요?"

CoT (사고의 연쇄): 이 문제를 풀기 위한 논리적인 생각의 흐름을 보여줍니다. (예: "밑면 중심 O에서 꼭짓점 B까지 선분 OB를 그린다...")

code: 질문을 시각적으로 이해하기 위해, 원본 사각뿔 이미지에 보조선(높이, 밑면 대각선 절반)을 추가하는 코드를 생성합니다.

Answer: 이 과정을 통해 sqrt(194)라는 정답을 도출합니다.

Data Evolution Flywheel

Data Evolution Flywheel은 상호작용 추론 데이터셋을 자동으로 합성, 진화, 검증하는 확장 가능한 프레임워크입니다.
이 프레임워크는 세 가지 프로세스로 구성됩니다.

Knowledge-driven Evolution

목표: 다양성 확보(Diversity: Knowledge-driven Evolution)

방법: 지식 시스템(K)과 도구 세트(T)를 함께 진화시키는 '공동 진화 루프'를 사용합니다. 지식이 새로운 도구를 만들도록 유도하고, 도구가 다시 새로운 지식을 생성하도록 하여 다양하고 복잡한 문제와 추론 데이터를 생성합니다.

Coordinated Calibration

목표: 품질 보증(Quality: Coordinated Calibration)

방법: 생성된 데이터의 (1) 정답 정확성, (2) 렌더링된 이미지의 유효성, (3) 추론 중 중간 시각 상태의 일관성을 검증합니다. 'Checker'가 이 기준을 통과한 샘플만 선별하고, 'Repairer'가 일부 불일치하는 데이터를 재구성하여 품질을 높입니다.

Progressive Expansion

목표: 난이도 조절(Difficulty: Progressive Expansion)

방법: 이미 검증된 데이터에 '병렬 확장' 또는 '순차적 확장'을 적용하여, 더 길고 복잡한 추론 체인을 가진 어려운 문제를 생성합니다.

Visual Progressive Training Curriculum

모델이 정확한 시각적 인식을 바탕으로 추론할 수 있도록 설계된 2단계 학습 프레임워크입니다.

Perception Alignment

목표: 기존 모델이 약한 세밀한 공간 인식(예: 점, 교차점의 정확한 위치 파악) 능력을 강화합니다.

방법: 점, 선, 각도 등 요소의 관계, 개수, 지식 개념을 조합하여 지각 데이터를 대량 합성합니다. 이 데이터를 사용하여 모델이 (1) 표면 수준 인식, (2) 의미 수준 추론, (3) 통합 추론 등 세 가지 복잡도 수준의 작업을 수행하도록 지도 학습을 진행합니다.

Interactive Reasoning Alignment

목표: 기본 인식 능력을 바탕으로 실제 상호작용 추론 능력을 고도화합니다.

Cold-Start Fine-tuning: 1단계에서 만든 데이터와 '데이터 플라이휠'로 생성한 데이터를 사용하여 표준적인 지도 학습을 수행합니다. 이를 통해 모델이 코드를 생성하고 이미지와 상호작용하는 기본 능력을 갖추게 합니다.

Reinforcement Learning: GRPO라는 강화 학습 기법을 사용하여 모델의 추론 능력을 최적화합니다. 모델이 생성한 코드를 샌드박스 환경에서 실행하고, 최종 답변의 정확도, 추론 형식, 도구 사용 여부를 바탕으로 계산된 보상을 받아 정책을 업데이트합니다.

profile
AI Researcher

0개의 댓글