[논문 리뷰] WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL

두부김치·2026년 4월 7일

논문 리뷰

목록 보기
11/26
post-thumbnail

Title : WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL(Arxiv 2026)
논문 링크 : https://arxiv.org/pdf/2602.13977
blog: https://rlinf.readthedocs.io/en/latest/rst_source/examples/embodied/wan.html

1. Introduction

  • VLA모델과 Imitation Learning의 한계

    • VLA 모델의 확산: 최근 로봇 조작 분야에서는 language instructions와 visual observations를 조건으로 action을 생성하는 Vision-Language-Action(VLA) 모델이 널리 채택되고 있음.
    • Imitation Learning의 제약: 대부분의 VLA는 imitation learninig으로 훈련되지만, 이는 demonstration data의 품질과 범위(coverage)에 의해 성능의 상한선(performance ceiling)이 결정된다는 근본적인 한계가 있음.
  • Reinforcement learning(RL) 도입의 어려움

    • RL의 필요성: RL은 VLA 모델의 성능을 실질적으로 개선하고 imitation data에 대한 의존도를 낮출 수 있는 유망한 대안임 -> 즉, 일반화를 해결 할 수 있는 Key
    • Physical Robot의 제약: 하지만 PPO나 GRPO같은 표준 알고리즘은 대규모의 환경 병렬화(environment parallelsim)를 요구하며, 이는 비용이 많이 들고 속도가 느린 real-world physcial robot환경에서는 실현하기 매우 어려움.
    • World Model의 부상: 이러한 제약으로 인해 실제 환경에서의 상호작용을 학습된 world model로 대체하여 policy optimization을 위한 시뮬레이터로 사용하는 방향이 검토됨.
  • World model의 Hallucination

    • 불완전한 Simulator: 학습된 world model은 완벽한 시뮬레이터가 아니며, closed-loop imagined interaction 중에 실제와 맞지 않는 hallucination(환각) 현상을 일으킴.
    • Error Accumulation: autoregressive feedback으로 인해 초기 오류가 증폭되거나, policy가 진화함에 따라 발생하는 발생하는 distribution shift로 인해 예측 실패가 증가하며 오류가 누적됨.
    • Optimization Signal의 오염: 이러한 hallucination은 RL이 실제 task progress가 아닌 모델의 오류를 exploit하도록 유도하여 optimization signal을 부패시킴.

Optimization Signal 오염이란?

  • Optimization signal: RL에서 모델이 +보상 또는 -보상을 받는 피드백을 의미. 이 신호를 따라 모델은 자신의 행동을 수정(Optimize)함.
  • Hallucination의 개입: world model이 완벽하지 않아서, 실제로는 로봇팔이 컵을 놓쳤는데 영상 속에서는 컵을 잡은 것처럼 hallucination을 일으킬 수 있음
  • 오류를 Exploit: 로봇(VLA)가 실제 물리 법칙을 지키며 컵을 잡는 법을 배우기 보다, "특정 각도로 휘두르면 world model이 오류를 일으켜 컵을 잡았다고 착각하고 보상을 주네?" 라는 점을 발견함.
  • 오염: 결국 로봇은 task progress(컵을 잡는 실력)를 키우는게 아니라, 모델의 inaccuracies를 파고드는 이상한 꼼수만 배우게 됨. 이렇게 "잘못된 피드백"으로 인해 학습 방향 자체가 망가지는 것을 "optimization signal"이 부패(corrupt)했다"고 표현함.
  • 제안 방법: WoVR Framework
    • 논문은 world model을 모델링의 문제가 아닌 신뢰성(reliability)의 관점에서 접근하며, hallucination을 제어하기 위한 세 가지 메커니즘을 제안함.
      • Controllable Simulator Design: aciton-controllable하고 rollout-stable한 비디오 world model 구축
      • Reliable Interaction Protocol: Keyframe-initialized Rollouts(KIR)를 통해 유효 예측 깊이(effective error depth)를 단축
      • Policy-Model Alignment: Policy-Aligned Co-Evolution(PACE) 전략을 통해 모델과 정책 간의 일치성 유지
  • 주요 기여 및 성과(Contribution)
    • SOTA 성능 달성: WoVR은 지각적/시각적 지표에서 뛰어난 world-model quality를 보여주며 23FPS의 높은 rollout efficiency를 유지
    • Task Performance 향상: LIBERO benchmark에서 평균 성공률을 39.95%에서 69.2%로 real-robot에서는 61.7%에서 91.7%로 향상시킴.

2. Related Work

  • Online RL Fine-tuning for VLA Models

    • 기존 방식의 한계: 최근 imitation learning을 넘어 VLA 모델을 fine-tune하기 위해 on-policy reinforcement learning이 도입되고 있음. 하지만 실제 로봇 환경에서는 대규모의 parallel rollouts, 반복적인 environment resets, 긴밀한 policy-environment interaction을 지원하기 어려워 직접적인 적용이 불가능에 가까움.
    • 대안 방법: off-policy 방식이나 human intervention을 도입하기도 하지만, 확장성(scalability)이 떨어지거나 온라인 업데이트 중 성능 저하가 발생함.
    • 결론: 이러한 한계는 알고리즘의 문제라기보다 시스템적인 문제이며, 따라서 실제 환경과의 상호작용을 분리(decouple)할 수 있는 world-model based 접근법이 필요함.
  • World models

    • large-scale general-purpose world models의 발전: 최근 대규모 world model들은 뛰어난 long-horzion generation과 spatial memory 능력을 보여주었음. 그러나 이들은 주로 마우스/키보드 제어 기반의 내비게이션 테스크를 위해 설계되었으며, 훈련 과정이 매우 복잡하고 방대한 데이터가 필요함.
    • Emabodied Manipulation의 특수성: 로봇 조작(manipulation)은 고정된 시점(fixed viewpoints), 로컬적으로 제한된 역학(locally constrained dynamics), 그리고 정교한 물체 상호작용(fine-grained object interactions)이라는 차별화된 특징을 가짐.
    • 기존 모델의 문제점: 기존의 action-conditioned world model들은 action responsiveness는 개선되었으나, 추론 속도가 느리고 장기 생성 시 error accumulation이 심하며 미세한 물리적 상호작용 모델링이 불안정하다는 단점이 있음.
  • World models as Simpulators

    • 단순 데이터 생성기와의 차이: 많은 연구가 world model에서 생성된 데이터로 VLA를 훈련하는 가능성을 탐색했지만, 이를 진정한 simulator로 취급하지는 않았음.
    • 기존연구(World-Env, WMPO)의 한계: 일부 최신 연구들이 world model을 시뮬레이터로 쓰기 시작했으나, 단순히 기존 시뮬레이터를 대체하는 수준(drop-in replacement)에 그침
    • WoVR의 차별점: 기존 방식들은 hallucinated dynamics하에서의 RL이라는 근본적 과제를 해결하지 못함. 즉, rollout horizons을 조절하거나, 성공 이후의 hallucinations를 억제하거나, policy optimization을 세계 모델의 신뢰 영역에 맞게 정렬하는 전용 메커니즘이 부족함.

3. Preliminary

  • Reinforcement Learning for VLA Fine-tuning
    • 최근 연구들은 imitation learning의 한계를 넘어서기 위해 reinforcement learning(RL)을 도입하여 VLA Policy를 사후 학습(post-train)하고 있음. 이 설정에서 policy optimization은 다음과 같은 MDP로 구성
      • M=(O,A,P,R,γ)M = (O, A, P, R, \gamma)
        • OO: Visual Observation oto_t와 language instruction ltl_t
        • AA: 정책 πθ\pi_{\theta}가 출력하는 chunked action ata_t
        • PP: 행동에 따른 상태 전이(state transition) ot+1P(ot,at)o_{t+1} \sim P(\cdot|o_t,a_t)
        • RR: 스칼라 보상(scalar reward) rt=R(ot,at)r_t = R(o_t,a_t)
      • 학습 목표: 기대 할인 리턴(expected discountd return) J(πθ)J(\pi_{\theta})를 최대화 하는것
      • Policy Gradient: 표준적인 On-Policy RL 방식을 따라, Advantage function A(ot,at)A(o_t,a_t)를 이용해 정책을 업데이트, 여기서 advantage는 현재 행동의 가치(Q)와 평균적인 상태 가치(V)의 차이를 의미
  • Problem Formulation: World Model-MDP
    • 실제 로봇 환경은 interaction cost 가 너무 높고 병렬화(parallelism)가 어렵기 때문에, 실제 환경을 학습된 world model로 교체해야 함. 이를 위해 저자들은 기존의 MDP를 World Model-MDP(WM-MDP)로 재정의
      • WM-MDP 정의: MWM=(O,A,P^ϕ,R^ψ,γ)M_{WM} = (O, A, \hat{P}_{\phi}, \hat{R}_{\psi}, \gamma)
        • P^ϕ\hat{P}_{\phi}: 학습된 world model에 의해 근사된 전이 역학(transition dynamics)
        • R^ψ\hat{R}_{\psi}: 학습된 reward function'
      • Imagined Rollout: 이 수식화 하에서 로봇은 물리적 환경이 아닌 world model과 상호작용하며 trajectories를 생성
        • o~t+1P^ϕ(ot,at)\widetilde{o}_{t+1} \sim \hat{P}_{\phi}(\cdot|o_t,a_t): Next Observation을 상상
        • r~t=R^ψ(o~t+1)\widetilde{r}_{t} = \hat{R}_{\psi}(\widetilde{o}_{t+1}): 상상한 화면에서 보상을 계산
      • 이를 통해 정책은 실제 로봇 없이 오직 상상(imagination)속에서만 closed-loop reollouts을 수행하고 최적화 될 수 있음.

4. Methods

  • Stabilized Action-Conditioned World Model(시뮬레이터 수준)
    • 단순한 비디오 생성 모델을 넘어, 로봇의 action에 정확히 반응하고 장기 실행 시에도 화면이 깨지지 않는 안정적인 시뮬레이터를 구축
      • Backbone & Action Conditioning: wan2.2-TI2V-5B 비디오 확산 모델을 기반으로 함. Dual-channel action injection 설계를 통해, action embeddings를 AdaLN-Zero 방식(로컬 변조)과 cross-Attention 방식 두 경로로 주입하여 정교한 action 제어 능력을 확보
      • First-frame Anchoring: autoregressive generation 시 발생하는 spatial drift(화면 밀림)와 배경 붕괴를 막기 위해 에피소드의 첫 프레임을 항상 참조(conditioning)하도록 고정
      • Training & Reward Model: Rectified Flow 목적 함수로 학습하며, 학습 시 noisy context를 주입하여 추론 시 발생하는 오차에 대한 내성(robustness)을 키움. 또한, 생성된 영상에서 성공 여부를 판단해 주는 별도의 learned reward classifier를 두어 binary success signal을 생성

  • Hallucination-Aware Policy Optimization
    • world model이 완벽하지 않다는 전제하에, hallucination의 영향을 최소화하도록 RL interaction방식을 재설계
      • keyframe-initialized Rollouts(KIR): 항상 시작 지점(O0O_0)에서만 시뮬레이션을 시작하면 끝으로 갈수록 오차가 너무 커짐. 대신, 과업의 핵심 상태나 정책이 실패했던 keyframes(oko_k)에서 시뮬레이션을 시작함으로써 effective error depth(오류가 쌓이는 깊이)를 획기적으로 줄임
      • Masked & Normalized GRPO: GRPO를 사용하여 업데이트하되, 상상 속에서 성공이 일어난 이후의 단계는 hallucination이 심하므로 마스킹 처리함. 또한, 각 trajectory를 유효 길이에 따라 정규화하여 짧고 핵심적인 시뮬레이션 구간이 학습을 주도하도록 함.

  • PACE: Policy-Aligned Co-Evolution

    • Policy가 변하면 로봇의 행동 방식이 바뀌고, 이는 world model이 학습하지 못한 데이터 분포(distribution shift)로 이어져 시뮬레이션의 신뢰도가 떨어짐
      • Co-Evolution Strategy: world model을 고정하지 않고 정책과 함께 진화시킴. 먼저 기초 정책으로 만든 WMBaseWM_{Base}에서 학습을 시작한 뒤, 어느 정도 개선된 정책으로 다시 데이터를 모아 world model을 WMEvoWM_{Evo}로 한번 더 정체(refinement)함.
      • Low-Frequency Refinement: 매 순간 모델을 업데이트 하는 기존 방식과 달리, 매우 낮은 빈도로 정제 작업을 수행하여 연산 효율성과 학습 안정성을 동시에 잡음.

    5. Experiments

  • 저자들은 World Model의 품질과, 이를 통해 학습된 VLA Policy가 실제 환경에서 얼마나 잘 작동하는지를 검증하였음.

  • World Model 시뮬레이터로서 충분히 안정적이고 효율적인가?

    • 저자들은 LIBERO environment에서 수집한 데이터를 바탕으로 WoVR과 기존 모델들(EVAC, Cosmos-Predict2, OpenSora)을 비교
      • 성능 지표: 시각적 유사도(LPIPS, FID), 비디오의 일관성(FVD), 그리고 동작의 정확성(FloLPIPS)을 측정했습니다.
      • 결과: WoVR은 모든 지표에서 기존 모델들은 압도, 특히 rollout horizon이 길어질수록(최대 512 frames) 타 모델들은 화면이 뭉개지거나 오류가 누적되었으나, WoVR은 안정적인 품질을 유지함.
      • 효율성: 5B 규모의 대형 backbone을 사용함에도 불구하고, 초당 23FPS의 추론 속도를 기록하여 실시간에 가까운 imagined rollout이 가능함을 보였음.

  • WoVR이 VLA의 Task Performance를 실제로 향상시키는가?

    • 학습된 세계 모델 안에서 RL을 수행했을 때, 로봇의 실력이 실제로 느는지 확인하기 위해 LIBERO task suites에서 실험함.
      • 실험 조건: 모든 방법론에 동일하게 2,500개의 실제 환경 trajectory를 할당
      • 결과: WoVR은 Spatial, Object, Goal, Long 모든 카테고리에서 가장 높은 성공률을 기록함.
        • Average Success Rate: 기존 Imitation Learning(BASE)은 39.9%, 실제 환경에서 직접 RL을 한 GRPO는 44.6%였으나, WoVR은 69.2%를 달성함.
        • 특히 장기 작업(Long suite)에서 기존 world model(WMPO)은 거의 개선이 없었으나, WoVR은 22.1%의 성능 향상을 보였슴.
  • 상상 속에서 배운 정책이 Real World로 잘 전이(Transfer)되는가?

    • 가상 세계에서만 배운 로봇이 실제 물리 환경에서도 잘 작동하는지 Franka Arm으로 테스트
    • Tasks: 바나나 집기(Pick banana), 빵 집기(Pick Bread)
    • Pick Banana: Success Rate 46.7% ~ 93.3%
    • Pick Bread: Success Rate 76.9% ~ 90.0%

의의: 추가적인 실제 로봇 상호작용 없이 오직 imagination 속의 학습만으로도 실물 로봇의 성능을 대폭 개선할 수 있음.

업로드중..

  • Ablation Study
  • WoVR의 각 기능이 얼마나 기여하는지도 분석했음.
    • World Model의 관점: First-frame ref와 Noisy context를 제거하면 화면의 spatial drift와 물체가 사라지는 현상이 심해짐.
    • Policy Optimization: KIR을 빼면 성공률이 81.5% -> 78.2%로 떨어지고 PACE를 빼면 71.0%까지 급락함. 즉, 모델과 정책을 실시가능로 맞춰주는 PACE가 핵심적인 역할을 함.
profile
Robotics

0개의 댓글