Title : World Guidance: World Modeling in Condition Space for Action Generation (ICML 2026)
논문 링크 : https://arxiv.org/pdf/2602.22010
blog: https://selen-suyue.github.io/WoGNet/
1. Introduction
2.1 World Action Models
- 기존 방식: VLM의 강력한 추론 능력이나 비디오 생성 모델(Stable Video Diffusion 등)을 활용해 미래 프레임, Depth, Optical Flow 같은 명시적 시각 정보나 시각 특징을 직접 예측, 생성하여 행동 제어에 활용
- WoG와의 차이점: 기존 방식은 과도한 시각적 중복(Redundacy)를 포함하지만, WoG는 행동 생성에 최적화된 저차원 조건 공간(Condition Space)을 학습하여 효율성을 극대화함.
2.2 Latent Action Models
- 기존 방식: 로봇 신체 구조(Embodiment)에 의존하지 않는 고차원 동작 패턴을 얻기 위해, Visual Reconstruction을 통해 미래 행동/동역학을 이산화(Discrete)되거나 압축된 잠재 공간으로 표현함.
- 한계: 잠재 공간이 PCA처럼 큰 변동성만 추출하여 대략적인 플래닝(Coarse Planning) 표현에 그치며, Fine-grained Control에 필요한 Hint가 부족함.
- WoG와의 차이점: 비디오나 시각을 직접 재구성하는 대신, 행동 유도에 직접적인 조건 예측(Condition Prediction)을 도입하여 정밀 제어에 필요한 핵심 안내 정보를 효과적으로 제공함.
3. Method

- 기본 VLA 모델의 동작 방식:
- 현재 시점 t의 Observation Ot와 언어 명령 l이 주어지면, VLM Backbone이 이를 z←f(Ot,l)로 인코딩함.
- Action Head는 latent z를 받아 미래 T개 단계의 행동 At:t+T를 P(At:t+T∣z) 확률 분포로 생성함.
- WoG의 Condition Space 개념:
- 미래 T개 단계의 미래 Observation Ot:t+T를 Condition Space Ot:t+Tc로 압축함.
- Stage 1에서는 미래 조건 Oc를 함께 받아 P(At:t+T∣z,Ot:t+Tc)를 모델링함으로써, 미래 hint가 포하된 행동을 생성함.
- Inference Time의 수식:
- 실제 로봇 추론 시점에는 미래 관측 Ot:t+T를 알 수 없으므로, 미래 조건 Ot:t+Tc역시 현재 관측 z로부터 스스로 추론해내야 함.
- 환경의 동역학이 결정론적(Deterministic)이라고 가정할 때, 전체 전체 추론 과정은 결합 확률 분포(Joint Distribution)로 다음과 같이 분리됨.
P(At:t+T,Ot:t+Tc∣z)=P(At:t+T∣z,Ot:t+Tc)P(Ot:t+Tc∣z)
3.2 Stage 1: World Guidance
- Stage 1의 목표는 (1) 미래 관측을 압축하여 행동 생성에 가장 유용한 조건 공간을 만들고, (2) Action Head가 이 조건을 활용해 정밀한 행동을 예측하도록 학습하는 것.
- VLM Backbone: OpenVLA에서 사용된 Prismatic VLM을 사용하며, 마지막 학습 가능 토큰(Action Token)의 출력 특징을 z로 사용함.
- 미래 Observation Sampling : 행동 시퀀스 T=16일 때, 미래 관측 이미지는 41 주기로 4개 프레임을 Sampling함
- Pretrained Vision Models:
- DINOv2: 각 미래 프레임에서 구체적인 Semantic/Structure 특징 추출
- Wan VAE Encoder: 현재 프레임과 미래 프레임을 함께 입력받아 Temporal/Spatial 동역학 특징 추출
- DINOv2 및 VAE에서 추출된 특징 지도를 평탄화(Flatten)한 후 결합.
- Q-former Encoder: N=16개의 학습 가능한 Query 토큰을 사용하여 Cross-Attention을 수행하고, 이를 차원 D=32의 압축된 미래 조건 표현 Oc로 Projection함.
3.2.3 Action Head 학습(Rectified Flow)
- Diffusion Transformer(DiT)기반 Action Head의 각 블록에 Oc를 Cross-Attention으로 주입함.
- Rectified Flow 알고리즘을 사용하여 Velocity Field를 예측하는 손실 함수를 최소화함.
LI=Eτ,A[∥vθ(Aτ,τ,z,Oc)−v∗∥22] (여기서 τ∈[0,1]는 스케줄링 타임스텝, vθ는 예측 속도, v∗는 타겟 속도)
3.3 Stage 2: World Inference
- Stage2에서는 외부 미래 observation 입력을 제거하고, VLM Backbone 스스로가 미래 조건을 예측하는 동시에 행동을 생성하도록 Co-training 시킴.
3.3.1 인코더 동결(Freeze)
- Stage 1에서 학습된 Q-former Future Encoder와 Vision Model Projector Freeze하여 타겟 조건 공간 Oc를 고정된 정답(Ground Truth)으로 만듬.
3.3.2 미래 조건 예측 정렬(Condition Alignment)
- VLM이 현재 관측만으로 미래 조건을 예측하도록, VLM의 Last hidden States 중 마지막 4개 토큰을 선택함.
- 16개의 학습 가능한 Query Embeddings를 도입하여 VLM Hidden state에 Cross-Attention을 수행한 뒤, 이를 32차원으로 Projection하여 fq(O,l)를 생성함.
- Frozen Future Encoder가 만든 Target Oc와 Cosine Similarity Loss로 정렬
3.3.3 Stage 2 Loss
- VLM의 출력 z만을 DiT Action Head에 입력하여 행동을 예측하는 Loss와 Condition Alignment Loss를 동시에 최적화함.
LII=Eτ,A[∥vθ(Aτ,τ,z)−v∗∥22]+1−S[Oc,fq(O,l)] (S[⋅,⋅]는 Cosine Similarity)
이 과정을 통해 VLM Backbone 내부 표현에 미래 관측 조건에 대한 지식이 Distill되어 테스트 시 현재 관측만으로 미래를 Self-Guided 하면서 정밀 제어를 수행할 수 있게 됨.
3.4 Learning From Human Manipulation
- 행동 라벨이 부족한 대규모 인간 데이터셋을 효율적으로 활용하기 위해 2가지 전략을 제공
- 전략 1(라벨 있는 인간 데이터 소량 + 라벨 없는 데이터 대량)
- Stage 1: 소량의 행동 라벨이 있는 인간 비디오 + 로봇 데이터를 함께 넣어 조건 공간 확대 및 인간의 조작 지식 습득
- Stage 2: 행동 라벨이 없는 대규모 비디오 데이터셋을 대거 추가하여 Condition Prediction Loss로만 학습시키고, Action Prediction Loss는 로봇 및 라벨이 있는 인간 데이터로만 적용
- 전략 2(라벨 없는 인간 비디오만 활용)
- Stage 1은 로봇 데이터로만 학습
- Stgae 2: 라벨이 없는 인간 비디오를 추가하여 Condition Prediction branch만 Supervise하고 Action Prediction Branch는 Masking함. 물체 이동 동역학 및 공통적인 미래 조건을 학습하여 일반화 성능 강화
4. Simulation Experiments
4.1 Setup
-
평가 환경: SIMPLER 환경 (Google Robot 및 WidowX 플랫폼)
- Google Robot(Fractal 데이터 기반):
- Visual Matching: 실제 환경과 시각적 차이를 최소화한 프로토콜
- Variant Aggregation: 배경, 조명, 방해물, 테이블 질감 등에 변화를 준 강한 Domain Shift 프로토콜
- WidowX (Bridge 데이터 기반): 다양한 Pick-and-Place 및 정밀 배치 과제 수행
-
실행 방식: 폐루프(Closed-Loop) 제어 방식이며, 매 타임스텝마다 단일 RGB 관측 이미지만 입력으로 받음.
-
비교 Baseline
- Conventional VLA: π0,π0-fast, OpenVLA, GROOT-N1 (Observation → Action 직접 매핑으로 받음)
- latent Action Models: Moto, UniVLA(잠재 행동 공간 활용)
- World Action Models: DeFI(비디오 예측 기반 동역학 활용)
- Latent Action + Video Gen: VITA, ViPRA(잠재 행동 + 비디오 생성 결합)
4.2 Results
- WoG는 대부분의 시뮬레이션 과제에서 기존 베이스라인 대비 압도적인 성능 향상을 보임


- 분석:
- 동적 궤적 계획 및 충돌 회피 우수성:
- 방해 물체가 존재하는 Move Near 과제나 정밀 위치 지정이 필요한 Pick Coke 등에서 궤적 생성 능력이 크게 향상됨.
- 비디오 생성 모델과의 차별점
- Full-scale 비디오 직접 예측(VPP, DeFI 등)은 픽셀 복원 오차가 행동 공간으로 전파되는 문제가 있음.
- 반면 WoG는 핵심 Segmentic Condition Space로 압축, 추출하여 시각 예측 오차 전파를 방지함.
- 한계점:
- Stack Green on yello 처럼 기히학적 정밀도나 마이크로 단위의 상대 위치 제어가 극도로 요구되는 일부 작업에서는 향상 폭이 비교적 제한적임.
4.3 Pretrained Encoder Configuration

- Q-former 입력 전 시각 모델 조합에 대한 성능 비교 실험
- DINOv2 : 기본적인 성능 제공
- DINOv2 + SigLIP : 고차원 시각-언어 Semantic을 보강하여 공간 정밀도가 중요한 Stack 과제에서 최고 성능(33.0%)을 달성(시뮬레이션 기본 설정으로 채택)
- DINOv2 + Wan VAE: 시공간 동역학을 잘 압축하여 Google Robot 기준 70.9%로 가장 높은 전체 평균 달성
4.4 Ablation Study

- Future Encoder(Q-former)로 조건 공간을 압축하는 과정의 필요성을 검증
- WoG w/o future enc: Encoder를 아예 빼고 원본 feature map전체와 직접 Alignment 수행 → 성능 하락(66.7%)
- WoG w/o Future Enc. in Stage 2: Stage 1에는 Encoder를 쓰지만 Stage2 조건 예측 시 원본 Feature map와 Alignment 수행 → 성능 하락(667%)
- WoG w Future Enc(Full): 저차원 조건 공간 Oc로 압축하여 정렬 → 최고 성능(70.9%)
- 결론: 시각 모델의 전체 feature map을 직접 맞추려 하는 것보다, Future encoder를 통해 압축된 저차원 행동 조건 공간(Oc)를 형성하고 이를 정렬시키는 것이 정밀 제어 및 일반화에 훨씬 효과적임을 입증함.
5. Real-World Experiments

5.1 실험환경 및 설정(Setup)
5.1.1 시스템 및 로봇 플랫폼
- 로봇 팔/그리퍼: UR5 로봇 팔 + Robotiq 2F-85 Gripper
- 카메라: Intel RealSense D435 (Top-Down 시점의 단일 RGB 관측 이미지 사용)
- 하드웨어/제어: NVIDIA RTX 4090 GPU / Maniunicon 제어 전략 사용(16단계 미래 행동 시퀀스를 예측한 뒤 앞선 8단계를 실행)
5.1.2 평가 태스크 및 데이터 구성
- 다양한 물체 속성(rigid-body, articulated, deformable)을 다루는 3가지 Task로 구성됨
- Pick and Place(P&P, rigid-body): 초록색 컵을 집어 접시 위에 놓는 작업(100개 데모), 테이블 위 장애물 및 접시 내 물체와의 충돌 회피 궤적 계획 능력 평가
- Close the Microwave(articulated): 전자레인지 문을 닫는 작업(100개 데모), 회전 동역학 제어 능력 평가
- Fold the Towel(deformable): 삼각 형태 수건의 꼭짓점을 잡아 반대쪽 꼭짓점과 5cm이내로 맞닿게 접는 작업(200개 데모)
5.1.3 OOD Setup
- 일반화 성능(Generalization)을 검증하기 위해 데모에 포함되지 않은 3가지 OOD 변형 조건을 적용함
- Background Change: 데모와 다른 식탁보 사용
- Light Change: 데모에 없던 수치 제어 조명을 작업 영역에 투사
- Novel Object: 수건 색상/재질 변경, 컵의 색상 및 형태 변경 후 언어 명령 수정
5.2 Results

- 각 태스크 및 OOD 조건별 20회씩 평가를 진행
5.3 Training Strategy / Ablation

- Vanila VLA: 현재 관측으로만 행동을 직접 예측하도록 학습
- WoG w/o cotrain: Stage1 학습 후 Stage2에서 Co-training없이 행동만 복습 함.
- WoG(Full): Stage2에서 Future Condition alignment와 Action Prediction을 동시 최적화
5.3 Learning from Human Data

행동 라벨이 없는 대규모 인간 비디오(1,920시간) 및 라벨이 있는 비디오(220시간)를 학습에 추가하였음.
- 라벨이 없는 비디오만 사용: Stage2의 Condition Prediction Learning에만 비디오를 사용함. P&P과제와 OOD 일반화는 개선되었으나, Deformable(Towel)과제는 사람과 로봇 간 조작 조건의 격차로 인해 약간 감소함.
- 소량의 라벨 비디오 포함: Stage 1 및 Stage 2 모두에 라벨 비디오를 활용함. 사람의 조작 조건 공간을 신속히 수용하여 모든 ID 및 OOD 환경에서 로봇 전용 데이터 학습 모델 대비 월등한 성적을 달성함.
5.4 Learning from UMI Data

- 1인칭(Egocentric) 시점의 UMI 데이터 120개 궤적ㅇㄹ Stage 2 Fine-tune시 추가하였음
- P&P 태스크 성공률 (42% 상승), Fold 태스크 성공률 33% 상승