VLA 모델의 확산: 최근 로봇 조작 분야에서는 language instructions와 visual observations를 조건으로 action을 생성하는 Vision-Language-Action(VLA) 모델이 널리 채택되고 있음.
Imitation Learning의 제약: 대부분의 VLA는 imitation learninig으로 훈련되지만, 이는 demonstration data의 품질과 범위(coverage)에 의해 성능의 상한선(performance ceiling)이 결정된다는 근본적인 한계가 있음.
Reinforcement learning(RL) 도입의 어려움
RL의 필요성: RL은 VLA 모델의 성능을 실질적으로 개선하고 imitation data에 대한 의존도를 낮출 수 있는 유망한 대안임 -> 즉, 일반화를 해결 할 수 있는 Key
Physical Robot의 제약: 하지만 PPO나 GRPO같은 표준 알고리즘은 대규모의 환경 병렬화(environment parallelsim)를 요구하며, 이는 비용이 많이 들고 속도가 느린 real-world physcial robot환경에서는 실현하기 매우 어려움.
World Model의 부상: 이러한 제약으로 인해 실제 환경에서의 상호작용을 학습된 world model로 대체하여 policy optimization을 위한 시뮬레이터로 사용하는 방향이 검토됨.
World model의 Hallucination
불완전한 Simulator: 학습된 world model은 완벽한 시뮬레이터가 아니며, closed-loop imagined interaction 중에 실제와 맞지 않는 hallucination(환각) 현상을 일으킴.
Error Accumulation: autoregressive feedback으로 인해 초기 오류가 증폭되거나, policy가 진화함에 따라 발생하는 발생하는 distribution shift로 인해 예측 실패가 증가하며 오류가 누적됨.
Optimization Signal의 오염: 이러한 hallucination은 RL이 실제 task progress가 아닌 모델의 오류를 exploit하도록 유도하여 optimization signal을 부패시킴.
Optimization Signal 오염이란?
Optimization signal: RL에서 모델이 +보상 또는 -보상을 받는 피드백을 의미. 이 신호를 따라 모델은 자신의 행동을 수정(Optimize)함.
Hallucination의 개입: world model이 완벽하지 않아서, 실제로는 로봇팔이 컵을 놓쳤는데 영상 속에서는 컵을 잡은 것처럼 hallucination을 일으킬 수 있음
오류를 Exploit: 로봇(VLA)가 실제 물리 법칙을 지키며 컵을 잡는 법을 배우기 보다, "특정 각도로 휘두르면 world model이 오류를 일으켜 컵을 잡았다고 착각하고 보상을 주네?" 라는 점을 발견함.
오염: 결국 로봇은 task progress(컵을 잡는 실력)를 키우는게 아니라, 모델의 inaccuracies를 파고드는 이상한 꼼수만 배우게 됨. 이렇게 "잘못된 피드백"으로 인해 학습 방향 자체가 망가지는 것을 "optimization signal"이 부패(corrupt)했다"고 표현함.
제안 방법: WoVR Framework
논문은 world model을 모델링의 문제가 아닌 신뢰성(reliability)의 관점에서 접근하며, hallucination을 제어하기 위한 세 가지 메커니즘을 제안함.
Controllable Simulator Design: aciton-controllable하고 rollout-stable한 비디오 world model 구축
Reliable Interaction Protocol: Keyframe-initialized Rollouts(KIR)를 통해 유효 예측 깊이(effective error depth)를 단축
Policy-Model Alignment: Policy-Aligned Co-Evolution(PACE) 전략을 통해 모델과 정책 간의 일치성 유지
주요 기여 및 성과(Contribution)
SOTA 성능 달성: WoVR은 지각적/시각적 지표에서 뛰어난 world-model quality를 보여주며 23FPS의 높은 rollout efficiency를 유지
기존 방식의 한계: 최근 imitation learning을 넘어 VLA 모델을 fine-tune하기 위해 on-policy reinforcement learning이 도입되고 있음. 하지만 실제 로봇 환경에서는 대규모의 parallel rollouts, 반복적인 environment resets, 긴밀한 policy-environment interaction을 지원하기 어려워 직접적인 적용이 불가능에 가까움.
대안 방법: off-policy 방식이나 human intervention을 도입하기도 하지만, 확장성(scalability)이 떨어지거나 온라인 업데이트 중 성능 저하가 발생함.
결론: 이러한 한계는 알고리즘의 문제라기보다 시스템적인 문제이며, 따라서 실제 환경과의 상호작용을 분리(decouple)할 수 있는 world-model based 접근법이 필요함.
World models
large-scale general-purpose world models의 발전: 최근 대규모 world model들은 뛰어난 long-horzion generation과 spatial memory 능력을 보여주었음. 그러나 이들은 주로 마우스/키보드 제어 기반의 내비게이션 테스크를 위해 설계되었으며, 훈련 과정이 매우 복잡하고 방대한 데이터가 필요함.
Emabodied Manipulation의 특수성: 로봇 조작(manipulation)은 고정된 시점(fixed viewpoints), 로컬적으로 제한된 역학(locally constrained dynamics), 그리고 정교한 물체 상호작용(fine-grained object interactions)이라는 차별화된 특징을 가짐.
기존 모델의 문제점: 기존의 action-conditioned world model들은 action responsiveness는 개선되었으나, 추론 속도가 느리고 장기 생성 시 error accumulation이 심하며 미세한 물리적 상호작용 모델링이 불안정하다는 단점이 있음.
World models as Simpulators
단순 데이터 생성기와의 차이: 많은 연구가 world model에서 생성된 데이터로 VLA를 훈련하는 가능성을 탐색했지만, 이를 진정한 simulator로 취급하지는 않았음.
기존연구(World-Env, WMPO)의 한계: 일부 최신 연구들이 world model을 시뮬레이터로 쓰기 시작했으나, 단순히 기존 시뮬레이터를 대체하는 수준(drop-in replacement)에 그침
WoVR의 차별점: 기존 방식들은 hallucinated dynamics하에서의 RL이라는 근본적 과제를 해결하지 못함. 즉, rollout horizons을 조절하거나, 성공 이후의 hallucinations를 억제하거나, policy optimization을 세계 모델의 신뢰 영역에 맞게 정렬하는 전용 메커니즘이 부족함.
3. Preliminary
Reinforcement Learning for VLA Fine-tuning
최근 연구들은 imitation learning의 한계를 넘어서기 위해 reinforcement learning(RL)을 도입하여 VLA Policy를 사후 학습(post-train)하고 있음. 이 설정에서 policy optimization은 다음과 같은 MDP로 구성
M=(O,A,P,R,γ)
O: Visual Observation ot와 language instruction lt
A: 정책 πθ가 출력하는 chunked action at
P: 행동에 따른 상태 전이(state transition) ot+1∼P(⋅∣ot,at)
R: 스칼라 보상(scalar reward) rt=R(ot,at)
학습 목표: 기대 할인 리턴(expected discountd return) J(πθ)를 최대화 하는것
Policy Gradient: 표준적인 On-Policy RL 방식을 따라, Advantage function A(ot,at)를 이용해 정책을 업데이트, 여기서 advantage는 현재 행동의 가치(Q)와 평균적인 상태 가치(V)의 차이를 의미
Problem Formulation: World Model-MDP
실제 로봇 환경은 interaction cost 가 너무 높고 병렬화(parallelism)가 어렵기 때문에, 실제 환경을 학습된 world model로 교체해야 함. 이를 위해 저자들은 기존의 MDP를 World Model-MDP(WM-MDP)로 재정의
WM-MDP 정의: MWM=(O,A,P^ϕ,R^ψ,γ)
P^ϕ: 학습된 world model에 의해 근사된 전이 역학(transition dynamics)
R^ψ: 학습된 reward function'
Imagined Rollout: 이 수식화 하에서 로봇은 물리적 환경이 아닌 world model과 상호작용하며 trajectories를 생성
ot+1∼P^ϕ(⋅∣ot,at): Next Observation을 상상
rt=R^ψ(ot+1): 상상한 화면에서 보상을 계산
이를 통해 정책은 실제 로봇 없이 오직 상상(imagination)속에서만 closed-loop reollouts을 수행하고 최적화 될 수 있음.
4. Methods
Stabilized Action-Conditioned World Model(시뮬레이터 수준)
단순한 비디오 생성 모델을 넘어, 로봇의 action에 정확히 반응하고 장기 실행 시에도 화면이 깨지지 않는 안정적인 시뮬레이터를 구축
Backbone & Action Conditioning: wan2.2-TI2V-5B 비디오 확산 모델을 기반으로 함. Dual-channel action injection 설계를 통해, action embeddings를 AdaLN-Zero 방식(로컬 변조)과 cross-Attention 방식 두 경로로 주입하여 정교한 action 제어 능력을 확보
First-frame Anchoring: autoregressive generation 시 발생하는 spatial drift(화면 밀림)와 배경 붕괴를 막기 위해 에피소드의 첫 프레임을 항상 참조(conditioning)하도록 고정
Training & Reward Model: Rectified Flow 목적 함수로 학습하며, 학습 시 noisy context를 주입하여 추론 시 발생하는 오차에 대한 내성(robustness)을 키움. 또한, 생성된 영상에서 성공 여부를 판단해 주는 별도의 learned reward classifier를 두어 binary success signal을 생성
Hallucination-Aware Policy Optimization
world model이 완벽하지 않다는 전제하에, hallucination의 영향을 최소화하도록 RL interaction방식을 재설계
keyframe-initialized Rollouts(KIR): 항상 시작 지점(O0)에서만 시뮬레이션을 시작하면 끝으로 갈수록 오차가 너무 커짐. 대신, 과업의 핵심 상태나 정책이 실패했던 keyframes(ok)에서 시뮬레이션을 시작함으로써 effective error depth(오류가 쌓이는 깊이)를 획기적으로 줄임
Masked & Normalized GRPO: GRPO를 사용하여 업데이트하되, 상상 속에서 성공이 일어난 이후의 단계는 hallucination이 심하므로 마스킹 처리함. 또한, 각 trajectory를 유효 길이에 따라 정규화하여 짧고 핵심적인 시뮬레이션 구간이 학습을 주도하도록 함.
PACE: Policy-Aligned Co-Evolution
Policy가 변하면 로봇의 행동 방식이 바뀌고, 이는 world model이 학습하지 못한 데이터 분포(distribution shift)로 이어져 시뮬레이션의 신뢰도가 떨어짐
Co-Evolution Strategy: world model을 고정하지 않고 정책과 함께 진화시킴. 먼저 기초 정책으로 만든 WMBase에서 학습을 시작한 뒤, 어느 정도 개선된 정책으로 다시 데이터를 모아 world model을 WMEvo로 한번 더 정체(refinement)함.
Low-Frequency Refinement: 매 순간 모델을 업데이트 하는 기존 방식과 달리, 매우 낮은 빈도로 정제 작업을 수행하여 연산 효율성과 학습 안정성을 동시에 잡음.
5. Experiments
저자들은 World Model의 품질과, 이를 통해 학습된 VLA Policy가 실제 환경에서 얼마나 잘 작동하는지를 검증하였음.
World Model 시뮬레이터로서 충분히 안정적이고 효율적인가?
저자들은 LIBERO environment에서 수집한 데이터를 바탕으로 WoVR과 기존 모델들(EVAC, Cosmos-Predict2, OpenSora)을 비교
성능 지표: 시각적 유사도(LPIPS, FID), 비디오의 일관성(FVD), 그리고 동작의 정확성(FloLPIPS)을 측정했습니다.
결과: WoVR은 모든 지표에서 기존 모델들은 압도, 특히 rollout horizon이 길어질수록(최대 512 frames) 타 모델들은 화면이 뭉개지거나 오류가 누적되었으나, WoVR은 안정적인 품질을 유지함.
효율성: 5B 규모의 대형 backbone을 사용함에도 불구하고, 초당 23FPS의 추론 속도를 기록하여 실시간에 가까운 imagined rollout이 가능함을 보였음.
WoVR이 VLA의 Task Performance를 실제로 향상시키는가?
학습된 세계 모델 안에서 RL을 수행했을 때, 로봇의 실력이 실제로 느는지 확인하기 위해 LIBERO task suites에서 실험함.
실험 조건: 모든 방법론에 동일하게 2,500개의 실제 환경 trajectory를 할당
결과: WoVR은 Spatial, Object, Goal, Long 모든 카테고리에서 가장 높은 성공률을 기록함.
Average Success Rate: 기존 Imitation Learning(BASE)은 39.9%, 실제 환경에서 직접 RL을 한 GRPO는 44.6%였으나, WoVR은 69.2%를 달성함.
특히 장기 작업(Long suite)에서 기존 world model(WMPO)은 거의 개선이 없었으나, WoVR은 22.1%의 성능 향상을 보였슴.
상상 속에서 배운 정책이 Real World로 잘 전이(Transfer)되는가?
가상 세계에서만 배운 로봇이 실제 물리 환경에서도 잘 작동하는지 Franka Arm으로 테스트
Tasks: 바나나 집기(Pick banana), 빵 집기(Pick Bread)
Pick Banana: Success Rate 46.7% ~ 93.3%
Pick Bread: Success Rate 76.9% ~ 90.0%
의의: 추가적인 실제 로봇 상호작용 없이 오직 imagination 속의 학습만으로도 실물 로봇의 성능을 대폭 개선할 수 있음.
Ablation Study
WoVR의 각 기능이 얼마나 기여하는지도 분석했음.
World Model의 관점: First-frame ref와 Noisy context를 제거하면 화면의 spatial drift와 물체가 사라지는 현상이 심해짐.
Policy Optimization: KIR을 빼면 성공률이 81.5% -> 78.2%로 떨어지고 PACE를 빼면 71.0%까지 급락함. 즉, 모델과 정책을 실시가능로 맞춰주는 PACE가 핵심적인 역할을 함.