Title : Towards Long-Lived Robots: Continual Learning VLA Models via Reinforcement Fine-Tuning (RSS 2026)
논문 링크 : https://www.roboticsproceedings.org/rss22/p086.pdf
blog: https://yuan-liu-lifelong-rft.github.io/

1. Introduction
-
VLA 한계
- 기존의 SFT(Supervised Fine-Tuning) 방식은 2가지 주요 한계가 존재
- 높은 데이터 의존성: 적은 데이터(Low-data / Few-shot)조건에서 빠른 적응이 어려움
- Catastrophic Forgetting : 새로운 기술 습득 시 이전 지식이 손실됨.
- Plasticity - Stability Dilemma
- 적응성(Plasticity)를 높이면 망각이 심해지고, 이전 지식을 유지(안정성)하려면 새 과제 학습이 제한됨.
- backbone model(VLM)의 representation이 뛰어나도 SFT 적용 시 발생하는 Catastrphic Forgetting을 완전히 해결하지 못함.
- On-policy 강화학습 Reward Function 방식의 방식
- LLM 분야에서는 현재 정책의 샘플을 이용하는 On-Policy RL이 Catastrophic forgetting에 효과적임이 입증됨.
- 하지만 VLA Fine-tuning에 기존 RL Reward 신호를 적용할 경우 다음과 같은 한계가 존재함.
- 주로 시뮬레이션에 국한되며 Privileged State 정보가 필요해 실제 배치 어려움.( 시뮬레이션에서는 Object의 정확한 위치 값이나, Robot의 정확한 Pose, 마찰계수 등 은 주어지지만 실제 환경에서는 얻기 쉽지 않음 → Privileged State)
- 예측 오차 및 일반화 오류로 인해 Reward Hacking에 매우 취약함. (Policy가 실제로 태스크를 수행하지 않으면서 높은 보상을 얻는것 → Reward Hacking, ex: 팔로 카메라 시야를 가려서 물체가 사라짐 = 집어 올림 으로 잘못 Inference)
- 높은 학습 비용: 두 방식 모두 Environment / World Model / Real-Robot 와의 광범위한 상호작용이 필요하여 비용이 극심함.
-
Proposed: LifeLong-RFT
- 환경 상호작용 없이 청크 단위(Chunking-level) On-Policy RL과 다차원 프로세스 보상 메커니즘(Multi-dimensional process reward mechanism)
- 3가지 Reward 요소 구성
- QACR : 이산 행동 공간 내 정확한 토큰 예측 보상
- CTAR : 디코딩된 연속 Action Chunk를 Reference trajectory와 정렬하여 정밀 제어 유도
- FCR : 출력 형식의 구조적 유효성을 보장하여 제어 실행 가능성 및 추론 효율성 향상.
-
Contributions
- 환경 상호작용 없이 적은 Demonstration data로 continual Learning이 가능한 Post-training LifeLong-RFT 제시
- Action Chunk의 이종 기여도를 3가지 차원(QACR, CTAR, FCR)으로 정량화하는 다차원 프로세스 보상 메커니즘 개발
- 시뮬레이션 및 실제 로봇 실험을 통해 Multi Task 성능 및 LIBERO 벤치마크 Continual Learning에서 SFT 대비 성공률 향상
2.1 VLA and Post-Training
- VLA 목표: Observation o와 Instruction l을 로봇 행동 a로 매핑하는 범용 로봇 정책 πθ(a∣o,l)을 학습하는 것
- Post-Training 과정: 대규모 데이터셋으로 사전 학습된 VLA 모델의 파라미터 θ를 특정 로봇 Embodiment 및 Downstream task 데이터에 맞추어 Post-train 함.
2.2 Continual Learning
- SFT의 한계: 기존 SFT 방식은 현재 학습 데이터셋의 성능만 최적화할 뿐, 이전에 학습된 지식의 저하(성능 열화)를 고려하지 않음.
- Continual Learning 정의: Long-lived agent은 이전 기술을 유지하면서 새로운 기술을 게속 배워야함.
- task sequence {Tk}k=1∞에 대해 각 과제 Tk마다 N개의 expert demostration data {τkn}n=1N이 제공되며, 과거 데이터 접근이 제한된 환경에서 지속적으로 지식을 습득해야 함.
2.3 On-Policy Reinforcement Learning
- Catastrophic Forgetting: SFT는 현재 Task 성능은 빠르게 올리지만 이전 능력을 급격히 상실시킴.
- On-Policy RL의 장점: 고정된 Dataset에 의존하는 SFT와 달리, 모델이 스스로 생성한 답변(Self-generated answers)을 바탕으로 정책을 업데이트하고 기대 리턴(Expected return)을 최적화함으로써 Forgetting에 대한 저항성(Robustness to forgetting)을 보여줌
3.Method

- LifeLong-RFT는 환경과 상호작용 없이 Chunk 단위의 On-Policy 강화학습과 다차원 프로세스 보상을 결합하여 VLA모델을 Fine-tuning함.
3.1 Chunking-Level On-Policy Reinforcement Learning
- 기존 VLA-RL 방식이 Full trajectory 수집과 환경 보상에 의존하여 학습 비용이 높았던 문제를 해결하기 위해 환경 상호작용 없이 독립적인 Action Chunk 단위로 정책을 평가 및 최적화 함.
- GRPO(Group Relative Policy Optimization) 적용
- 별도의 Critic Network없이 그룹 내 상대적 비교를 통해 Advantage를 추정하여 계산 오버헤드를 대폭 줄임.
- 최적화 프로세스
- Observation o와 Instruction l에 대해 이전 정책 πθold로 부터 G개의 행동 출력 그룹 {ai}i=1G을 샘플링함.
- 다차원 프로세스 보상 메커니즘을 통해 각 출력의 보상 {ri}i=1G을 계산함.
- Group 내 평균 및 표준편차를 이용해 상대적 어드밴티지 Ai를 산출함.
Ai=std({r1,…,rG})ri−mean({r1,…,rG})
- PPO 형태의 Clipping과 Reference Model(πref)과의 KL Divergence 제약 조건을 포함한 Object Function JGRPO(θ)를 극대화하여 급격한 정책 변화 및 망각을 방지함.

3.2 Multi-Dimensional Process Reward
- 환경 상호작용 없이도 On-Policy RL을 효과적으로 유도하기 위해, 행동 청크 평가를 3가지 상보적 Dimension으로 분해하여 보상을 제공
- Quantized Action Consistency Reward(QACR)
- 목적: 이산화된 행동 공간(Quantized Action Space)내에서 예측된 행동 토큰별 정확도를 평가함.
- 동작 방식
- 생성된 토큰에 대해 Fast+ Toknenizer 규격 준수 여부(Format Check)를 먼저 수행함.
- 검증을 통과한 예측 Token Sequence a={au}=u=1U 와 정답 토큰 시퀀스 a~={a~v}v=1V
QACR=max(U,V)∑l=1min(U,V)I(al=a~l)
- Continuous Trajectory Alignment Reward(CTAR)

- Format Compliance Reward(FCR)
- 목적: VLA모델이 출력 차원 및 Chunk 크기 규격을 이탈하여 구문 오류(Structural invalidity)를 내는 현상을 방지함.
- 동작 방식: Fast+ Tokenizer로 정상 디코딩 가능한 구문 구조를 만족하면 1, 그렇지 않으면 0을 부여하는 이진(Binary) 보상:
FCR={1,0,if validotherwise
3.3 Final Reward Synthesis
- 세 가지 차원의 보상을 결합하여 최종 보상 r을 구성함.
r=ω⋅QACR+(1−ω)⋅CTAR+λ⋅FCR
- ω∈[0,1]: 이산 토큰 일치도(QACR)와 연속 궤적 정렬(CTAR) 간의 밸런스를 조절함.
- λ: 구조적 포맷 준수(FCR)의 중요도를 스케일링함.
4. Experiments
4.1 Implementation Details
- 기반 모델: NORA-Long을 Base VLA 모델로 사용하며, 행동 표현을 위해 Fast+ Tokenizer를 채택함.
- 최적화 설정: RFT단계에서 전체 파라미터 미세조정(Full-parameter Optimization)을 진행함.
- GRPO Rollout Group 크기(G) : 8
- Optimizer : AdamW(Learning rate 1×10−6
- Reward Hyperparameter : CTAR의 α=5,β=0.8 / 최종 보상 가중치 ω=0.7.λ=0.1
- 하드웨어: NVIDIA H20 GPU 8
4.2 Multi-Task Learning Experiments
- 실험 환경 및 데이터:
- SimplerENV: WidowX (BridgeData V2) 및 Google Robot(Fractal) 플랫폼.
- LIBERO : 4개 Task Suite(Object, Spatial, Goal, Long) 모든 task
- Real-World(Franka): 4가지 실제 Task(Pick banana, Pick Bread, Pull Drawer, Hang Chinese Knot)
- Results:
- SimplerEnv: SFT 대비 WidowX에서 평균 +3.5%, Google Robot에서 평균 +4.4% 성공률 향상

- LIBERO: 평균 성공률 95.6%를 달성하여 기존 discrete/continous action model을 모두 제치고 최고 성능 달성

- Real-world : SFT 대비 평균 성공률 +8.7% 향상(특히 고난이도 "Hang Chinese Knot" Task에서 +15% 향상)


4.3 Continual Learning Experiments
-
Experiment Protocol:
- Base Task Stage: 초기 6개의 Task 학습(Task 당 50개 Episode)
- LifeLong Learning Stage: 순차적으로 4개 신규 Task 학습(Task 당 10개 Episode, 이전 Task 기억용 Replay 5개 유지)
- Metrics: FWT(New Task 적응력 ↑), NBT(Forgetting 수준 ↓), AUC(전체 평균 성공률 ↑)
-
Results
-
LIBERO : 모든 Task Suite에서 Baseline(SFT 및 BC 기반 Continual Learning Model)을 압도
- 특히 LIBERO-Goal에서 SFT eoql AUC 35.9 증가

-
Real-world : SFT 대비 FWT가 +23.7점 상승, NBT는 6.1로 낮게 유지하여 이전에 배운 기술의 Forgetting을 방지

4.4 Ablation Studies
- Multi-Dimensional Process Reward 구성 요소별 검증
- w/o CTAR: 연속 궤적 정렬 보상을 제거하면 평균 성공률이 90.9% 급락하여 과제 수행 능력을 거의 상실함.(가장 핵심)
- w/o QACR: discrete token 일치 보상 제거 시 평균 성공률 2.8% 하락
- w/o FCR: 포맷 준수 보상 제거 시 평균 성공률 2.6% 하락

- Adaptation Efficiency(신규 Task 적응 효율성)
- SFT 대비 현저히 적은 데모 수로 신규 Task에 빠르게 적응
- 예: "Pick Orange juice"Task에서 SFT는 50개 Demo로 98%에 도달한 반면, LifeLong-RFT는 단 5개의 Demo만으로 100% 성공률 달성