Title : World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy(Arxiv 2026)
논문 링크 : https://arxiv.org/pdf/2602.06508
blog: https://showlab.github.io/World-VLA-Loop/
1. Introduction

-
VLA모델의 발전
- LLM의 사전 지식을 활용하여 자연어 명령을 로봇의 저수준 제어(low-level control)로 직접 매핑하는 방식이 로봇 조작의 주류 패러다임으로 자리 잡음.
- 현재 대부분 VLA모델은 Imitation Learning에 의존하고 있는데, 이는 데이터 부족 문제와 테스트 시 발생하는 compounding errors로 인해 일반화 성능에 한계가 있음.
-
강화 학습(RL)의 어려움
- 해결책으로서의 RL: 최근 연구들은 정책을 정제하기 위해 강화 학습을 통합하여, 전문가의 시연 데이터 없이도 최적에 못 미치는 행동으로부터 스스로 회복할 수 있도록 유도함.
- 하지만, Real-World에서의 RL은 수천 번의 물리적 구동이 필요하며, 매번 사람이 개입하여 환경을 리셋해야 하고 탐색 과정 중 안전 사고 위험이 있어 비용이 매우 많이 듬.
-
기존 World Model의 카테고리와 단점
- 물리적 RL의 한계를 극복하기 위해 World Model을 가상 환경으로 활용하려는 시도가 있으며, 크게 세 가지 패러다임으로 나뉨.
- Handcrafted digital twins: 물리 엔진을 사용하지만 사진과 같은 실사감(photorealism)과 물리적 충실도가 부족함.
- 3D-based reconstruction: 기하학적 방법론을 사용하지만 다양한 환경으로의 일반화가 어렵고 확률적 탐색을 지원하지 못함.
- Video World Model: 사전 학습된 비디오 생성 모델을 활용해 일반화 성능은 좋으나, 행동 추종(action-following)이 부정확하고 보상 신호가 근거가 부족함. 특히, 잘못된 행동을 입력해도 성공한 것처럼 영상을 조작하는 '환각'현상이 발생함.
-
World-VLA-Loop 제안
- 본 논문은 이러한 정밀한 행동 추종과 신뢰할 수 잇는 보상 신호 문제를 해결하기 위해 World-VLA-Loop를 제안
- Co-evolving: VLA가 학습됨에 따라 행동 양식이 변한다는 점에 착안하여, 업데이트된 정책이 생성한 실패 궤적을 다시 월드 모델에 피드백하여 보상과 행동 추종 능력을 강화하는 순환 구조를 생성
- SANS 데이터셋: 성공 episode와 더불어 근접 성공(near-success) 사례를 포함한 SANS 데이터셋을 도입하여 모델이 행동과 결과 사이의 정렬을 더 날카롭게 학습하도록 함.
- 상태 인지 모델: 미래 영상과 보상을 동시에 예측하는 상태 인지 비디오 월드 모델을 고충실도의 가상 환경을 구축
2. Method

- SANS(Success and Near-Success) 데이터셋 구축
- 기존 로봇 데이터셋은 주로 Success episode에만 집중하여, World Model이 물리적으로 발생 가능한 다양한 실패 모드를 학습하기 어려움.
- 정의: 목표에 거의 도달했으나 말단 장치(end-effector)의 미세한 위치 오류로 실패한 '근접 성공' 궤적을 포함한 데이터셋
- 필요성:
- 성공과 매우 유사한 궤적을 통해 World Model이 미세한 공간 역학 변화에 집중하도록 강제함.
- 로봇 정책 구동 시 흔히 발생하는 실패 양상을 가상 환경에 정확히 반영하기 위함.
- 수집 방법:
- Maniskill: 정답(Ground-Truth) 포즈를 섭동(perturbation)시켜 실패 사례를 생성
- LIBERO & 실환경: SFT된 OpenVLA-OFT 정책의 실제 구동 결과(rollouts)에서 자연스러운 실패 모드를 획득하거나, 사람이 직접 teleoperation을 통해 의도적인 실패 케이스를 생성
- state-aware Video World Simulator
- Cosmos-Predict 2를 백본으로 사용하며, 단순 영상 생성을 넘어 보상 신호를 직접 출력할 수 있도록 설계함.
- 보상 예측 헤드(Reward Prediction Head):
- DiT(Diffusion Transformer)에서 생성된 잠재 상태(latent)를 입력받아 스칼라 보상값 r^을 예측하는 가벼운 MLP층을 추가
- 공동 학습(Joint Training): 영상 생성 손실(Lflow)과 보상 예측 손실(Lreward)을 함께 최적화하여, 시각적 결과와 보상의 일치성을 높임.
- 장점: 외부 VLM이나 휴리스틱 보상 모델에 의존하지 않고, 생성된 비디오의 상태와 내부적으로 정렬된 신뢰도 높은 보상을 제공
- World Simulator for Policy RL Post-Training
- 학습된 World Model을 물리 시뮬레이터 대신 사용하여 VLA 정책을 정제
- Closed-loop Interaction:
- VLA 정책이 행동을 생성하면 World Model이 다음 Observation과 Reward를 생성
- 이 Observation이 다시 Policy의 입력으로 들어가는 순환 과정을 통해 가상 공간에서 다단계 구동(Multi-step rollouts)을 수행함.
- 최적화 알고리즘: GRPO를 사용하여 정책을 업데이트 함.
- 효율성: H100 노드 기준 24프레임 생성에 약 7초가 소요되며, 한 task당 30시간의 훈련으로 수렴 가능
- Iterative Joint-Optimization
- Policy와 World Model이 함께 진화하는 핵심 cycle
- 배포 및 수집: RL로 업데이트된 정책을 실제(또는 타겟)환경에 배포하여 새로운 성공 및 실패 데이터를 수집
- 데이터 증강: 수집된 데이터를 SANS데이터셋에 추가하여 World Model을 다시 Fine-tunning함.
- 반복: 정밀해진 World Model을 바탕으로 다음 단계의 정책 RL을 수행하여 성능을 지속적으로 높임.
3. Experiment
5. Conclusion
- 새로운 패러다임 제시: World Model과 VLA정책을 함께 최적화하는 공동 최적화(Joint Optimization)기반의 새로운 VLA 강화 학습 프레임워크를 보임
- Near-Success trajectory을 포함한 SANS 데이터셋과 Reward Head를 통합함으로써, 가상 환경에서도 실제와 유사한 시뮬레이션 가능
- 현재의 Autoregressive 비디오 모델은 문맥 기억 능력이 제한적이며, 200프레임(약 20초)이상의 긴 작업에서는 영상 품질이 저하되는 Quality drift문제가 발생