Title : What Can RL Bring to VLA Generalization? An Empirical Study(NeurIPS 2025)
논문 링크 : https://openreview.net/pdf?id=qmBMPInbZC
github: https://github.com/gen-robot/RL4VLA
Abstract
- 기존 VLA방식들의 일반화가 안된다는 문제점이 있음 -> 이러한 문제를 해결하기위해 Reinforcemen Learning방식이 같이 사용됨.
- RL은 여러 시행착오를 통해 이러한 일반화 문제를 해결할 수 있는 경로를 제공해줌. 하지만, Supervised FineTunning(SFT)와 비교했을 때 RL이 VLA의 일반화를 해결해주는지에 대한 근본적인 분석이 부족함.
- 해당 논문은 VLA의 일반화를 평가하기 위한 포괄적인 벤치마크를 도입하고, 다양한 방식으로 RL 미세 조정의 영향을 분석함.
- PPO가 VLA와 같이 사용할때 다른 RL방식들(DPO, GRPO)보다 일반화 성능을 높히는 분석과, VLA에 대한 효율적인 PPO 학습에 대한 레시피를 제공함.

Introduction
-
Internet-Scale의 데이터셋으로 학습된 VLA 모델은 Observation, Instruction을 바탕으로 로봇 행동으로 직접 매핑할 수 있게 발전되옴, 또한, Single arm, Dual arm, Nav및 Unseen Environment나 Complicated Environment, Long horizon Task에 대해 유망한 일반화 성능을 보임
-
하지만, 이러한 일반화에도 불구하고, VLA모델은 주로 Human Demonstration의 Behavior Cloning을 통한 Supervised Finetunning에 의존하는 문제가 있음.
-
이러한 문제는 학습된 데이터 분포 즉, In-Distribution에 대한 학습 데이터가 아닌 분포 외 OOD(Out-of-Distribution)의 조작에 대해서는 강건한 성능을 저해하는 문제가 있음.
-
학습 분포와 테스트 분포 간의 이러한 불일치는 강건성을 근본적으로 제한함.
-
RL은 시행착오를 통해 누적 작업 보상을 직접 최적화하는 패러타임을 제공하여, 정책이 좁은 전문가 데이터를 넘어 탐색하고 수정 행동을 학습할 수 있도록하기 때문에, SFT는 훈련 데이터를 암기하는 경향이 있는 반면, RL은 분포 외 성능을 훨씬 더 향상시키고 더 큰 추론 능력을 발휘할 수 있는 장점이 있음.
-
하지만, 이런 노력에도 불구하고, RL Finetunning이 VLA에 부여하는 특정 일반화 이점이 무엇인지, 특히 SFT로 학습된 VLA와 비교하였을 때 각자의 강점이 어떻게 다른지에 대한 체계적인 이해는 아직 충분하지 않음.
-
본 논문은 RL과 SFT로 Finetuning된 VLA의 일반화 속성을 분석하기 위한 체계적인 연구를 수행함.
- SFT보다 RL이 VLA 일반화에 가져올 수 있는 이점은 무엇인가?
-
위의 질문에 답하기 위해, 본 논문에서는 대표적인 Pick and Place Task에 대해 실험을 진행하였고, 이 Task에서 대규모 모델을 위한 RL 알고리즘(PPO, DPO, GRPO)을 평가하여 효과적인 VLA Finetunning 전략을 식별함.
-
또한, Pick and place 작업에서도 RL Finetunning이 SFT를 능가하는 지점을 파악함.
-
평가는 세가지 환경에서 진행이 되었음.
- Vision: 새로운 배경(보지못한 테이블)으로 일반화 성능을 어렵게 만듬(전경 또는 전체 이미지에 보지 못한 질감을 겹쳐서 적용)
- Semantics: 보지못한 객체, 새로운 용기, 다양한 지시문을 통해 이해도를 테스트하여 Language sensitivity와 object recognition을 탐색
- execution: 초기 로봇 상태, 객체/용기 위치를 다양하게 변경하고 에피소드 내에서 객체를 무작위로 재배치하는 등의 dynamic disturbances를 도입하여 견고성 탐색
-
본 논문의 contribution은 다음과 같음.
- diverse vision, semantics, execution에 걸쳐 VLA finetuning 방법에 대한 일반화 성능에 미치는 영향을 평가하기 위한 벤치마크 수립
- 선호되는 RL 알고리즘에서 PPO로부터 RL알고리즘을 조정하는데 주요 과제 논의
- 공유 actor-critic, VLA model warm-up, minimal PPo training epochs를 통해 효율적인 PPO 기반 VLA finetunning 레시피 제공
- VLA에 대해 sematics과 execution Environment에서 SFT보다 RL의 우수한 일반화 성능을 입증하며, Vision 에 대한 환경에서 견고성을 유지함.
Preliminaries
- 본 논문에서는 Language-conditioned 로봇 작업 T∈Γ를 Partially Observable Markov Decision Process(POMDP) 로 모델링하며, 이는 M=(S,A,P,R,O,L,P(so),γ) 로 정의함.
- A는 Action Space, O는 Observation, P는 Transition Probability
- 각 작업 T는 instruction LT⊂L과 stage S가 작업 단계를 완료하거나 지침 l을 만족할때 Reward R(s,l)∈R을 가짐.
- 에피소드는 instruction l∼LT와 초기 stage so∼P(so)로 시작하며, 로봇의initial pose와 environment를 정의함.
- Policy πθ는 마지막 H개의 Observation ot−H+1:t와 language instruction l을 사용하여 action at∼πθ(at∣ot−H+1:t,l)을 출력하며, trajectory τ=(O0,a0,⋯)을 구성함.
Supervised fine-tunning(SFT) : SFT는 human demonstration으로 수집된 DT={(τ(i),l(i))}i=1N로부터 학습되며, 각 trajecotry τ(i)=(o0(i),a0(i),⋯oKi−1(i),aKi−1(i))이고 N은 총 trjactory수.
- VLA Policy πθ는 다음과 같은 최소화함.
LSFT(θ)=(τ(i),l(i))∈DT∑t=0∑Ki−1lSFT(a^t(i),at(i))
여기서 lSFT는 VLA 아키텍처 및 action representation에 기바한 Loss Function.
RL Fine-tunning: Reinforcement Learning Finetunnig은 환경과의 직접적인 상호작용을 통해 Scalar Rewards 또는 Preference signals를 최대화함.
보상이 있는 경우, 길이를 M으로 하는 에피소드에 대한 Negative discounted return을 최소화함.
LRL(θ)=−Eτ∼πθ[t=0∑M−1γtR(st,l)],
종종 Policy-gradient인 Surrogate를 사용하기도함. 선호도가 있는 경우, DPO같은 모델에서는 pariwise/ranked feedback을 사용하여 선호하는 trajectory에 대해 πθ를 최적화 함.
Effective RL fine-tunning of VLA models
- 본 논문에서는 RL로 VLA 모델을 fine tunning하는 방법을 탐구함,
- 해당 모델들은 Pre trained된 LLM/VLM backbone으로부터 유사한 규모와 구조를 상속받기 때문에 먼저 LLM/VLM과 같은 대규모 모델에 일반적인 RL 알고리즘이 VLA에 효과적으로 전이되는지 테스트함.
RL algorithms: PPO, GRPO, DPO
-
세 가지 대표적인 RL 알고리즘인 PPO, GRPO, DPO를 고려하고 모든 모델은 rank=32인 LoRA을 사용하여 미세조정되었음.
PPO: On-Policy Update를 수행하며, 새로 수집된 Rollout으로부터 clipped된 중요도 비율과 Generalised Advantage Estimation(GAE)를 사용하여 Policy gradients를 계산함. 여기서 Open-Reasoner-Zero(ORZ) 연구로부터 영감을 받아, GAE를 비활성화하는 것(γ=1,λ=1)이 대규모 모델 fine tunning시 성능을 향상시킬 수있음을 보여주기때문에, 본 논문에서는 표준 PPO와 변형 PPO-ORZ 모두를 평가.
GRPO: 샘플 그룹을 사용하여 베이스라인을 추정하여 명시적인 value estimation없이 장점의 직접적인 계산을 가능하게 함. 본 논문에서는 GRPO설정을 따라 공통 초기 상태에서 궤적을 샘플링하며, 각 그룹은 8개의 궤적을 포함함.
DPO: pairwise preference 주석이 달린 오프라인 데이터셋을 활용함. 하지만 로봇 작업에서는 동일한 initial Pose에서 얻은 대조적인 trajectory를 얻는 것이 어려움. 본 논문에서는 보상 신호로부터 trajectory 수준의 선호도를 추론.
-
이 세가지 RL 알고리즘을 기반으로 Pick and place 작업에서 성능을 평가하였음.각 실험은 두개의 다른 랜덤 시드를 사용하여 수행됨. 연구 결과 PPO가 GRPO보다 일관되게 우수함을 보임. 이는 langauge instruction과 robot task간의 환경 동적 특성의 근본적인 차이에 기인한다고 봄. 저자들은 로봇 작업의 POMDP에서 각 행동이 비정상적인 방식으로 환경 상태를 순차적으로 변경하여 GRPO의 장점 추정치를 불안정하게 만들 수 있다고 가정함. 또한, PPO가 DPO보다 좋음.

Design factors of PPO
- 본 논문에서는 PPO가 OpenVLA와 효과적으로 작동하도록 몇 가지 주요 설계를 제안함. 이러한 설계를 통해 주요 실험은 수렴하는데 단일 NVIDIA A100 GPU에서 약 42시간이 소요됨.
Shared actor-critic backbone: 대부분의 최신 강화학습은 Actor-critic 형식을 사용하므로 본 논문에서는 사전학습된 VLA정책을 Actor로 취급하고, Stage Value V(s).를 추정하는 lightweight critic을 부착함.
아키텍쳐를 간결하게 유지하기 위해 Actor와 Critic은 전체 transformer backbone을 공유함. 3개의 MLP value head는 첫번째 Action-Token 위치에서 최종 transformer block이 생성한 hidden vector h0.를 받아 scalar값으로 회귀함.
이 value head 구조를 검증하기위해, 여러 Critic 구조를 설계하고 평가함. 첫번째는 action-token 임베딩 ho를 value head에 공급하는 것이 가장 높고 안정적인 반환값을 생성했으며, 마지막 토큰 입력 hn 및 연결된 [h0,⋯,hn]보다 우수하였음.
자체 transformer backbone을 사용하는 critic은 유사한 보상을 달성했지만, 학습 속도는 35%느렸고 VRAM 사용량은 83% 더 많았음.(81.3GB vs 44.4GB) -> 이러한 결과는 h0를 사용하는 공유 백본이 가장 효율적인 선택임.

VLA warm-up: 본 논문에서는 OXE 데이터셋으로 pre trained된 OpenVLA checkpoint를 사용하여 모든 실험을 진행함. 해당 checkpoint가 저자들이 제안한 벤치마크에서 성능이 저조했기 때문에, Octo-Small 및 Motion Planner로 수집된 140개의 demonstration trajectory로 이를 warm-up시킴. warm-up 모델은 약 50% 적은 fewer environemnt steps로 수렴에 도달하면서도, 두 초기화 모두 충분한 상호작용이 주어졌을 때 유사한 반환값을 달성.

Minimal PPO epoch: 저자들은 update-to-data ratio가 효율적인 fine tunning을 위한 핵심 요소라고 제안. PPO에서 이 비율은 epoch 로 설정되며, 이는 각 배치에 몇번의 gradient pass가 발생하는지를 지정함. PPO epoch을 1이상으로 늘리는것이 return이나 샘플효율성에서 이득을 주지 않으며, 오히려 실제 시간을 거의 선형적으로 증가시킨다는 것을 보여줌. 저자들은 모든 실험에서 epoch=1로 고정함.
Evaluating fine-tunning methods on VLA generalization
Environments and datasets
- 본 논문에서는 VLA의 일반화 능력을 분석하기 위해, 에이전트(로봇)가 테이블에서 물체를 받침대로 옮기도록 지시받는 일반적인 Pick and Place 작업에 초점을 맞춤.
- 일반화 평가는 다음 세가지에 따라 나뉨
- vision: foreground와 background의 변화뿐만 아니라, 약하거나 강한 강도로 적용되는 이미지 수준의 dynamic noise를 포함
- semantics: object, Receptacles, instruction의 이전에 보지 못한 변형을 고려, 또한, 두 object중 하나를 선택해야 하는 작업, 기존에 보았거나 보지못한 object set를 사용.
- execution: object와 receptacles의 initial pose 변화, robot의 initial pose 자세를 변형, 또한 작업 중에 object의 pose가 변경되는 시나리오도 도입.
- 보상은 sparse함. 올바른 object를 잡고 지속적으로 잡고있으면 0.1, 성공적으로 놓으면 1.0으로 줌.
- 저자들은 SFT가 demonstration count에 따라 어떻게 확장되는지 연구함. OpenVLA를 수백 개에서 64k개의 trajectory에 이르는 데이터셋으로 수렴할 때까지 훈련하고, 분포 내 및 보지 못한 객체/테이블에 대한 세 개의 무작위 시드에 대한 평균점수를 보고함. 두 설정 모두에서 성능이 약 16K trajectory에서 roughly되는것을 관찰함. 저자들은 RL fine tunning 방법 비교를 위한 baseline으로 16k trajectory SFT checkpoint를 채택

- 위 그림에서 훈련 분포와 OOD object/table 분할 모두에 대한 RL 훈련 중 성공률을 다양한 데이터 규모에서 SFT 점수와 함께 표시함. RL은 OOD 작업에서 약 0.4M 환경 step 후에 가장 성능이 좋은 16k SFT checkpoint를 능가함. 수렴 시, 훈련 설정에서는 SFT-16k와 비슷하게 수행되며, 보지 못한 객체와 테이블에서는 42.6% 더 나은 성능을 보여, 강화학습이 In distribution 하에서의 정책 성능을 향상시 킬 뿐만 아니라, 현저히 더 강력한 일반화 성능을 제공함을 보여줌.
- 또한 저자들은, 수렴된 RL 정책과 가장 성능이 좋은 SFT 정책의 일반화 성능을 OOD 작업에 대해 평가함. 여기서는 평균 성공률과 평균 성능 저하를 보고함. 성능 저하는 P=INDOOD−IND 결과는 RL이 vision 작업에서는 SFT와 비슷하게, Semantics 작업과 execution작업에서는 성능이 더 좋음을 보임.
- Vision 작업의 경우, RL이나 SFT 모두 시각적 강건성 성능 하락으로 비슷한 성능을 보인다고 분석, Semantic 작업에서는 RL이 OOD 객체에 대한 Grasp 기술을 학습함으로써 성능이 더 좋다고 말함.

Dissecting RL's contributions to generalization
- 저자들은 두 접근 방식의 질적 차이를 분석하기 위해, 4가지 대표적인 작업에 대한 policy rollout을 시각화함.
- vision/dynamic-Noise(strong) 작업에서는 SFT 에이전트는 잡기 직 후 object를 반복적으로 떨어트리는데, 이는 심한 시각적 교란이 receptacle을 국소화하는 것을 방해하기 때문이라고 함. Semantics의 Unseen object의 경우 SFT는 이미 잡고 있는 물체를 게속 잡으려고 시도하며 멈추지만, RL은 지속적으로 들어올려 작업을 완료함. 이는 RL이 훈련 중에 보지못한 object와 상호작용할 때 더 세밀한 제어가 가능해짐을 입증. RL은 또한 두 가지 execution 테스트에서 fail grasp와 에피소드 중간 객체 이동으로부터 복구하는 것을 학습함.
- 반면, SFT는 Pose error에도 불구하고 세고 task를 수행하는데(엉뚱한 위치로) 이는, 훈련된 데모 데이터셋에 이러한 분포가 없기 때문이라고 분석, 이에대해서는 훈련 중 마주치는 trajectory distribution에서 나오는데, RL trajectory는 더 풍부한 넓은 작업 공간과 더 풍부한 end-effector 방향 범위를 포함하는 반면, SFT rollout은 dataset에 의존하면서 trajectory가 clustering됨을 보여줌.

Conclusion
- 본 논문에서는 RL fine tunning이 VLA 모델의 일반화에 어떤 영향을 미치는지에 대한 분석논문임.
- PPO변형이 가장 강력하고 효율적인 이득을 제공함을 보임.
- SFT와 비교하였을 때, RL 접근 방식은 분포 변화 하에서 semantic grounding와 execution 에서 눈에 띄게 개선하며, 시각적 교란에 대한 복원력도 이에 필적
Limitations: SFT를 위해 motion planner 생성 시연에만 의존하는데, 이는 human demonstration에 존재하는 다양성을 완전히 포착하지 못할 수 있음.
평가는 Pick and Place에만 국한됨. 더 복잡한 task에 대해 확장
시뮬레이션에만 평가하였기 때문에 Real world로 확장이 필요.
오랜만의 리뷰 잘 보고 갑니다~