[논문 리뷰] World Guidance: World Modeling in Condition Space for Action Generation

두부김치·2026년 8월 4일

논문 리뷰

목록 보기
23/26
post-thumbnail

Title : World Guidance: World Modeling in Condition Space for Action Generation (ICML 2026)
논문 링크 : https://arxiv.org/pdf/2602.22010
blog: https://selen-suyue.github.io/WoGNet/

1. Introduction

  • 연구 배경 및 목표

    • VLA모델이 미래 상황을 예측하고 모델링하는 능력을 갖추면 로봇의 작업 수행 능력을 크게 향상시킬 수 있음.
    • 기존 연구들은 단순 행동 예측을 넘어 미래 관측 신호를 예측하고 이를 행동 생성에 활용하는 방안을 모색함.
  • 기존 접근 방식의 한계(Trade-off 발생)

    • World Action Models(명시적 미래 예측): Video, Depth, Semantic 등 고차원 미래 관측을 직업 예측함
      • 한계: 정보는 풍부하지만 로봇 조작에 불필요한 중복(Redundancy)정보가 많아 계산 효율성이 떨어지고 정밀 제어를 방해함.
    • Latent Action Models(잠재 행동 모델): 미래 행동이나 동역학을 압축된 잠재 공간으로 변환함.
      • 한계: 고차원 계획에는 유용하나 표현이 너무 대략적(Coarse)이어서 정밀한 저차원 로봇 제어(Fine-grained Control)에 필요한 미세 hint가 부족 즉, feature 정보가 압축되다보니 Fine-grained control에 필요한 미세한 정보가 손실됨.
  • 핵심 도전 과제

    • VLA모델이 예측하기 쉬우면서도(Tractable), 정밀한 행동 생성을 안내할 수 있는 '충분히 표현력 있고 비중복적인 Predictive Space'를 찾는 것
  • 제안하는 해결책: WoG(World Guidance)

    • 미래 관측 자체를 직접 예측/생성하는 대신, 행동 생성 파이프라인에 주입되는 '조건 공간(Condition Space)'으로 미래 관측을 압축, 예측함.
    • 2단계 커리큘럼 학습 구조
      • Stage 1(Guidance): 현재 관측과 함께 frozen 사전학습 시각 모델 및 Q-former 기반 인코더로 압축된 미래 Observation Representation을 Condition으로 주입하여 Action head를 학습
      • Stage 2(Inference): Q-former 인코더를 freeze하여 목표 표현을 고정하고, VLM이 현재 관측만으로 이 미래 조건 표현과 행동을 동시에 내부적으로 예측(Self-guided)하도록 학습
  • 주요 성과 및 검증

    • 시뮬레이션 및 실제 로봇 환경 실험에서 기존 미래 예측 기반 VLA 모델 대비 정밀 제어 및 일반화 성능 대폭 향상
    • 대규모 인간 조작 비디오(Label 유/무) 및 UMI 데이터로부터 미래 조건 모델링을 효과적으로 학습하여 실전 로봇 배포 성능 증대

2. Related Work

2.1 World Action Models

  • 기존 방식: VLM의 강력한 추론 능력이나 비디오 생성 모델(Stable Video Diffusion 등)을 활용해 미래 프레임, Depth, Optical Flow 같은 명시적 시각 정보나 시각 특징을 직접 예측, 생성하여 행동 제어에 활용
  • WoG와의 차이점: 기존 방식은 과도한 시각적 중복(Redundacy)를 포함하지만, WoG는 행동 생성에 최적화된 저차원 조건 공간(Condition Space)을 학습하여 효율성을 극대화함.

2.2 Latent Action Models

  • 기존 방식: 로봇 신체 구조(Embodiment)에 의존하지 않는 고차원 동작 패턴을 얻기 위해, Visual Reconstruction을 통해 미래 행동/동역학을 이산화(Discrete)되거나 압축된 잠재 공간으로 표현함.
  • 한계: 잠재 공간이 PCA처럼 큰 변동성만 추출하여 대략적인 플래닝(Coarse Planning) 표현에 그치며, Fine-grained Control에 필요한 Hint가 부족함.
  • WoG와의 차이점: 비디오나 시각을 직접 재구성하는 대신, 행동 유도에 직접적인 조건 예측(Condition Prediction)을 도입하여 정밀 제어에 필요한 핵심 안내 정보를 효과적으로 제공함.

3. Method

3.1 Problem Formulation

  • 기본 VLA 모델의 동작 방식:
    • 현재 시점 t의 Observation OtO_t와 언어 명령 ll이 주어지면, VLM Backbone이 이를 zf(Ot,l)z \leftarrow f(O_t, l)로 인코딩함.
    • Action Head는 latent zz를 받아 미래 TT개 단계의 행동 At:t+TA_{t:t+T}P(At:t+Tz)P(A_{t:t+T}\vert{}z) 확률 분포로 생성함.
  • WoG의 Condition Space 개념:
    • 미래 TT개 단계의 미래 Observation Ot:t+TO_{t:t+T}를 Condition Space Ot:t+TcO^c_{t:t+T}로 압축함.
    • Stage 1에서는 미래 조건 OcO^c를 함께 받아 P(At:t+Tz,Ot:t+Tc)P(A_{t:t+T}\vert{}z, O_{t:t+T}^c)를 모델링함으로써, 미래 hint가 포하된 행동을 생성함.
  • Inference Time의 수식:
    • 실제 로봇 추론 시점에는 미래 관측 Ot:t+TO_{t:t+T}를 알 수 없으므로, 미래 조건 Ot:t+TcO^c_{t:t+T}역시 현재 관측 zz로부터 스스로 추론해내야 함.
    • 환경의 동역학이 결정론적(Deterministic)이라고 가정할 때, 전체 전체 추론 과정은 결합 확률 분포(Joint Distribution)로 다음과 같이 분리됨.
P(At:t+T,Ot:t+Tcz)=P(At:t+Tz,Ot:t+Tc)P(Ot:t+Tcz)P(A_{t:t+T}, O_{t:t+T}^c \mid z) = P(A_{t:t+T} \mid z, O_{t:t+T}^c) P(O_{t:t+T}^c \mid z)

3.2 Stage 1: World Guidance

  • Stage 1의 목표는 (1) 미래 관측을 압축하여 행동 생성에 가장 유용한 조건 공간을 만들고, (2) Action Head가 이 조건을 활용해 정밀한 행동을 예측하도록 학습하는 것.

3.2.1. 입력 및 특징 추출(Feature Extraction)

  • VLM Backbone: OpenVLA에서 사용된 Prismatic VLM을 사용하며, 마지막 학습 가능 토큰(Action Token)의 출력 특징을 zz로 사용함.
  • 미래 Observation Sampling : 행동 시퀀스 T=16T=16일 때, 미래 관측 이미지는 14\frac{1}{4} 주기로 4개 프레임을 Sampling함
  • Pretrained Vision Models:
    • DINOv2: 각 미래 프레임에서 구체적인 Semantic/Structure 특징 추출
    • Wan VAE Encoder: 현재 프레임과 미래 프레임을 함께 입력받아 Temporal/Spatial 동역학 특징 추출

3.2.2 Q-former 기반 Future Encoder(Conditioning)

  • DINOv2 및 VAE에서 추출된 특징 지도를 평탄화(Flatten)한 후 결합.
  • Q-former Encoder: N=16N=16개의 학습 가능한 Query 토큰을 사용하여 Cross-Attention을 수행하고, 이를 차원 D=32D=32의 압축된 미래 조건 표현 OcO^c로 Projection함.

3.2.3 Action Head 학습(Rectified Flow)

  • Diffusion Transformer(DiT)기반 Action Head의 각 블록에 OcO^c를 Cross-Attention으로 주입함.
  • Rectified Flow 알고리즘을 사용하여 Velocity Field를 예측하는 손실 함수를 최소화함.
    LI=Eτ,A[vθ(Aτ,τ,z,Oc)v22]\mathcal{L}_{I} = \mathbb{E}_{\tau, A} \left[ \left\Vert{} v_{\theta}(A_{\tau}, \tau, z, O^c) - v^* \right\Vert{}_2^2 \right]
    (여기서 τ[0,1]\tau \in [0, 1]는 스케줄링 타임스텝, vθv_\theta는 예측 속도, vv^*는 타겟 속도)

3.3 Stage 2: World Inference

  • Stage2에서는 외부 미래 observation 입력을 제거하고, VLM Backbone 스스로가 미래 조건을 예측하는 동시에 행동을 생성하도록 Co-training 시킴.

3.3.1 인코더 동결(Freeze)

  • Stage 1에서 학습된 Q-former Future Encoder와 Vision Model Projector Freeze하여 타겟 조건 공간 OcO_c를 고정된 정답(Ground Truth)으로 만듬.

3.3.2 미래 조건 예측 정렬(Condition Alignment)

  • VLM이 현재 관측만으로 미래 조건을 예측하도록, VLM의 Last hidden States 중 마지막 4개 토큰을 선택함.
  • 16개의 학습 가능한 Query Embeddings를 도입하여 VLM Hidden state에 Cross-Attention을 수행한 뒤, 이를 32차원으로 Projection하여 fq(O,l)f_q(O, l)를 생성함.
  • Frozen Future Encoder가 만든 Target OcO^c와 Cosine Similarity Loss로 정렬

3.3.3 Stage 2 Loss

  • VLM의 출력 z만을 DiT Action Head에 입력하여 행동을 예측하는 Loss와 Condition Alignment Loss를 동시에 최적화함.
    LII=Eτ,A[vθ(Aτ,τ,z)v22]+1S[Oc,fq(O,l)]\mathcal{L}_{II} = \mathbb{E}_{\tau, A} \left[ \left\Vert{} v_{\theta}(A_{\tau}, \tau, z) - v^* \right\Vert{}_2^2 \right] + 1 - \mathcal{S}\left[ O^c, f_q(O, l) \right]
    (S[,]\mathcal{S}[\cdot, \cdot]는 Cosine Similarity)
    이 과정을 통해 VLM Backbone 내부 표현에 미래 관측 조건에 대한 지식이 Distill되어 테스트 시 현재 관측만으로 미래를 Self-Guided 하면서 정밀 제어를 수행할 수 있게 됨.

3.4 Learning From Human Manipulation

  • 행동 라벨이 부족한 대규모 인간 데이터셋을 효율적으로 활용하기 위해 2가지 전략을 제공
  • 전략 1(라벨 있는 인간 데이터 소량 + 라벨 없는 데이터 대량)
    • Stage 1: 소량의 행동 라벨이 있는 인간 비디오 + 로봇 데이터를 함께 넣어 조건 공간 확대 및 인간의 조작 지식 습득
    • Stage 2: 행동 라벨이 없는 대규모 비디오 데이터셋을 대거 추가하여 Condition Prediction Loss로만 학습시키고, Action Prediction Loss는 로봇 및 라벨이 있는 인간 데이터로만 적용
  • 전략 2(라벨 없는 인간 비디오만 활용)
    • Stage 1은 로봇 데이터로만 학습
    • Stgae 2: 라벨이 없는 인간 비디오를 추가하여 Condition Prediction branch만 Supervise하고 Action Prediction Branch는 Masking함. 물체 이동 동역학 및 공통적인 미래 조건을 학습하여 일반화 성능 강화

4. Simulation Experiments

4.1 Setup

  • 평가 환경: SIMPLER 환경 (Google Robot 및 WidowX 플랫폼)

    • Google Robot(Fractal 데이터 기반):
      • Visual Matching: 실제 환경과 시각적 차이를 최소화한 프로토콜
      • Variant Aggregation: 배경, 조명, 방해물, 테이블 질감 등에 변화를 준 강한 Domain Shift 프로토콜
    • WidowX (Bridge 데이터 기반): 다양한 Pick-and-Place 및 정밀 배치 과제 수행
  • 실행 방식: 폐루프(Closed-Loop) 제어 방식이며, 매 타임스텝마다 단일 RGB 관측 이미지만 입력으로 받음.

  • 비교 Baseline

    • Conventional VLA: π0,π0\pi_0, \pi_0-fast, OpenVLA, GROOT-N1 (Observation \rightarrow Action 직접 매핑으로 받음)
    • latent Action Models: Moto, UniVLA(잠재 행동 공간 활용)
    • World Action Models: DeFI(비디오 예측 기반 동역학 활용)
    • Latent Action + Video Gen: VITA, ViPRA(잠재 행동 + 비디오 생성 결합)

4.2 Results

  • WoG는 대부분의 시뮬레이션 과제에서 기존 베이스라인 대비 압도적인 성능 향상을 보임

  • 분석:
    • 동적 궤적 계획 및 충돌 회피 우수성:
      • 방해 물체가 존재하는 Move Near 과제나 정밀 위치 지정이 필요한 Pick Coke 등에서 궤적 생성 능력이 크게 향상됨.
    • 비디오 생성 모델과의 차별점
      • Full-scale 비디오 직접 예측(VPP, DeFI 등)은 픽셀 복원 오차가 행동 공간으로 전파되는 문제가 있음.
      • 반면 WoG는 핵심 Segmentic Condition Space로 압축, 추출하여 시각 예측 오차 전파를 방지함.
    • 한계점:
      • Stack Green on yello 처럼 기히학적 정밀도나 마이크로 단위의 상대 위치 제어가 극도로 요구되는 일부 작업에서는 향상 폭이 비교적 제한적임.

4.3 Pretrained Encoder Configuration

  • Q-former 입력 전 시각 모델 조합에 대한 성능 비교 실험
    • DINOv2 : 기본적인 성능 제공
    • DINOv2 + SigLIP : 고차원 시각-언어 Semantic을 보강하여 공간 정밀도가 중요한 Stack 과제에서 최고 성능(33.0%)을 달성(시뮬레이션 기본 설정으로 채택)
    • DINOv2 + Wan VAE: 시공간 동역학을 잘 압축하여 Google Robot 기준 70.9%로 가장 높은 전체 평균 달성

4.4 Ablation Study

  • Future Encoder(Q-former)로 조건 공간을 압축하는 과정의 필요성을 검증
  • WoG w/o future enc: Encoder를 아예 빼고 원본 feature map전체와 직접 Alignment 수행 \rightarrow 성능 하락(66.7%)
  • WoG w/o Future Enc. in Stage 2: Stage 1에는 Encoder를 쓰지만 Stage2 조건 예측 시 원본 Feature map와 Alignment 수행 \rightarrow 성능 하락(667%)
  • WoG w Future Enc(Full): 저차원 조건 공간 OcO^c로 압축하여 정렬 \rightarrow 최고 성능(70.9%)
  • 결론: 시각 모델의 전체 feature map을 직접 맞추려 하는 것보다, Future encoder를 통해 압축된 저차원 행동 조건 공간(OcO^c)를 형성하고 이를 정렬시키는 것이 정밀 제어 및 일반화에 훨씬 효과적임을 입증함.

5. Real-World Experiments

5.1 실험환경 및 설정(Setup)

5.1.1 시스템 및 로봇 플랫폼

  • 로봇 팔/그리퍼: UR5 로봇 팔 + Robotiq 2F-85 Gripper
  • 카메라: Intel RealSense D435 (Top-Down 시점의 단일 RGB 관측 이미지 사용)
  • 하드웨어/제어: NVIDIA RTX 4090 GPU / Maniunicon 제어 전략 사용(16단계 미래 행동 시퀀스를 예측한 뒤 앞선 8단계를 실행)

5.1.2 평가 태스크 및 데이터 구성

  • 다양한 물체 속성(rigid-body, articulated, deformable)을 다루는 3가지 Task로 구성됨
  • Pick and Place(P&P, rigid-body): 초록색 컵을 집어 접시 위에 놓는 작업(100개 데모), 테이블 위 장애물 및 접시 내 물체와의 충돌 회피 궤적 계획 능력 평가
  • Close the Microwave(articulated): 전자레인지 문을 닫는 작업(100개 데모), 회전 동역학 제어 능력 평가
  • Fold the Towel(deformable): 삼각 형태 수건의 꼭짓점을 잡아 반대쪽 꼭짓점과 5cm이내로 맞닿게 접는 작업(200개 데모)

5.1.3 OOD Setup

  • 일반화 성능(Generalization)을 검증하기 위해 데모에 포함되지 않은 3가지 OOD 변형 조건을 적용함
  • Background Change: 데모와 다른 식탁보 사용
  • Light Change: 데모에 없던 수치 제어 조명을 작업 영역에 투사
  • Novel Object: 수건 색상/재질 변경, 컵의 색상 및 형태 변경 후 언어 명령 수정

5.2 Results

  • 각 태스크 및 OOD 조건별 20회씩 평가를 진행

5.3 Training Strategy / Ablation

  • Vanila VLA: 현재 관측으로만 행동을 직접 예측하도록 학습
  • WoG w/o cotrain: Stage1 학습 후 Stage2에서 Co-training없이 행동만 복습 함.
  • WoG(Full): Stage2에서 Future Condition alignment와 Action Prediction을 동시 최적화

5.3 Learning from Human Data

행동 라벨이 없는 대규모 인간 비디오(1,920시간) 및 라벨이 있는 비디오(220시간)를 학습에 추가하였음.

  • 라벨이 없는 비디오만 사용: Stage2의 Condition Prediction Learning에만 비디오를 사용함. P&P과제와 OOD 일반화는 개선되었으나, Deformable(Towel)과제는 사람과 로봇 간 조작 조건의 격차로 인해 약간 감소함.
  • 소량의 라벨 비디오 포함: Stage 1 및 Stage 2 모두에 라벨 비디오를 활용함. 사람의 조작 조건 공간을 신속히 수용하여 모든 ID 및 OOD 환경에서 로봇 전용 데이터 학습 모델 대비 월등한 성적을 달성함.

5.4 Learning from UMI Data

  • 1인칭(Egocentric) 시점의 UMI 데이터 120개 궤적ㅇㄹ Stage 2 Fine-tune시 추가하였음
  • P&P 태스크 성공률 (42% 상승), Fold 태스크 성공률 33% 상승
profile
Robotics

0개의 댓글