[논문 리뷰] Towards Long-Lived Robots: Continual Learning VLA Models via Reinforcement Fine-Tuning

두부김치·2026년 8월 11일

논문 리뷰

목록 보기
26/26

Title : Towards Long-Lived Robots: Continual Learning VLA Models via Reinforcement Fine-Tuning (RSS 2026)
논문 링크 : https://www.roboticsproceedings.org/rss22/p086.pdf
blog: https://yuan-liu-lifelong-rft.github.io/

1. Introduction

  • VLA 한계

    • 기존의 SFT(Supervised Fine-Tuning) 방식은 2가지 주요 한계가 존재
      • 높은 데이터 의존성: 적은 데이터(Low-data / Few-shot)조건에서 빠른 적응이 어려움
      • Catastrophic Forgetting : 새로운 기술 습득 시 이전 지식이 손실됨.
    • Plasticity - Stability Dilemma
      • 적응성(Plasticity)를 높이면 망각이 심해지고, 이전 지식을 유지(안정성)하려면 새 과제 학습이 제한됨.
      • backbone model(VLM)의 representation이 뛰어나도 SFT 적용 시 발생하는 Catastrphic Forgetting을 완전히 해결하지 못함.
    • On-policy 강화학습 Reward Function 방식의 방식
      • LLM 분야에서는 현재 정책의 샘플을 이용하는 On-Policy RL이 Catastrophic forgetting에 효과적임이 입증됨.
      • 하지만 VLA Fine-tuning에 기존 RL Reward 신호를 적용할 경우 다음과 같은 한계가 존재함.
      • 주로 시뮬레이션에 국한되며 Privileged State 정보가 필요해 실제 배치 어려움.( 시뮬레이션에서는 Object의 정확한 위치 값이나, Robot의 정확한 Pose, 마찰계수 등 은 주어지지만 실제 환경에서는 얻기 쉽지 않음 \rightarrow Privileged State)
      • 예측 오차 및 일반화 오류로 인해 Reward Hacking에 매우 취약함. (Policy가 실제로 태스크를 수행하지 않으면서 높은 보상을 얻는것 \rightarrow Reward Hacking, ex: 팔로 카메라 시야를 가려서 물체가 사라짐 = 집어 올림 으로 잘못 Inference)
      • 높은 학습 비용: 두 방식 모두 Environment / World Model / Real-Robot 와의 광범위한 상호작용이 필요하여 비용이 극심함.
  • Proposed: LifeLong-RFT

    • 환경 상호작용 없이 청크 단위(Chunking-level) On-Policy RL과 다차원 프로세스 보상 메커니즘(Multi-dimensional process reward mechanism)
    • 3가지 Reward 요소 구성
      • QACR : 이산 행동 공간 내 정확한 토큰 예측 보상
      • CTAR : 디코딩된 연속 Action Chunk를 Reference trajectory와 정렬하여 정밀 제어 유도
      • FCR : 출력 형식의 구조적 유효성을 보장하여 제어 실행 가능성 및 추론 효율성 향상.
  • Contributions

    • 환경 상호작용 없이 적은 Demonstration data로 continual Learning이 가능한 Post-training LifeLong-RFT 제시
    • Action Chunk의 이종 기여도를 3가지 차원(QACR, CTAR, FCR)으로 정량화하는 다차원 프로세스 보상 메커니즘 개발
    • 시뮬레이션 및 실제 로봇 실험을 통해 Multi Task 성능 및 LIBERO 벤치마크 Continual Learning에서 SFT 대비 성공률 향상

2. Problem Formulation and Preliminaries

2.1 VLA and Post-Training

  • VLA 목표: Observation oo와 Instruction ll을 로봇 행동 aa로 매핑하는 범용 로봇 정책 πθ(ao,l)\pi_{\theta}(a\vert{}o,l)을 학습하는 것
  • Post-Training 과정: 대규모 데이터셋으로 사전 학습된 VLA 모델의 파라미터 θ\theta를 특정 로봇 Embodiment 및 Downstream task 데이터에 맞추어 Post-train 함.

2.2 Continual Learning

  • SFT의 한계: 기존 SFT 방식은 현재 학습 데이터셋의 성능만 최적화할 뿐, 이전에 학습된 지식의 저하(성능 열화)를 고려하지 않음.
  • Continual Learning 정의: Long-lived agent은 이전 기술을 유지하면서 새로운 기술을 게속 배워야함.
  • task sequence {Tk}k=1\left\{\mathcal{T}_k\right\}^{\infty}_{k=1}에 대해 각 과제 Tk\mathcal{T}_k마다 NN개의 expert demostration data {τkn}n=1N\left\{\tau_{k}^{n}\right\}_{n=1}^{N}이 제공되며, 과거 데이터 접근이 제한된 환경에서 지속적으로 지식을 습득해야 함.

2.3 On-Policy Reinforcement Learning

  • Catastrophic Forgetting: SFT는 현재 Task 성능은 빠르게 올리지만 이전 능력을 급격히 상실시킴.
  • On-Policy RL의 장점: 고정된 Dataset에 의존하는 SFT와 달리, 모델이 스스로 생성한 답변(Self-generated answers)을 바탕으로 정책을 업데이트하고 기대 리턴(Expected return)을 최적화함으로써 Forgetting에 대한 저항성(Robustness to forgetting)을 보여줌

3.Method

  • LifeLong-RFT는 환경과 상호작용 없이 Chunk 단위의 On-Policy 강화학습과 다차원 프로세스 보상을 결합하여 VLA모델을 Fine-tuning함.

3.1 Chunking-Level On-Policy Reinforcement Learning

  • 기존 VLA-RL 방식이 Full trajectory 수집과 환경 보상에 의존하여 학습 비용이 높았던 문제를 해결하기 위해 환경 상호작용 없이 독립적인 Action Chunk 단위로 정책을 평가 및 최적화 함.
  • GRPO(Group Relative Policy Optimization) 적용
    • 별도의 Critic Network없이 그룹 내 상대적 비교를 통해 Advantage를 추정하여 계산 오버헤드를 대폭 줄임.
  • 최적화 프로세스
    • Observation oo와 Instruction ll에 대해 이전 정책 πθold\pi_{\theta_{old}}로 부터 GG개의 행동 출력 그룹 {ai}i=1G\left\{a_i\right\}^G_{i=1}을 샘플링함.
    • 다차원 프로세스 보상 메커니즘을 통해 각 출력의 보상 {ri}i=1G\left\{r_i\right\}_{i=1}^G을 계산함.
    • Group 내 평균 및 표준편차를 이용해 상대적 어드밴티지 AiA_i를 산출함.
      Ai=rimean({r1,,rG})std({r1,,rG})A_i = \frac{r_i - \text{mean}(\{r_1, \dots, r_G\})}{\text{std}(\{r_1, \dots, r_G\})}
    • PPO 형태의 Clipping과 Reference Model(πref\pi_{ref})과의 KL Divergence 제약 조건을 포함한 Object Function JGRPO(θ)J_{GRPO}(\theta)를 극대화하여 급격한 정책 변화 및 망각을 방지함.

3.2 Multi-Dimensional Process Reward

  • 환경 상호작용 없이도 On-Policy RL을 효과적으로 유도하기 위해, 행동 청크 평가를 3가지 상보적 Dimension으로 분해하여 보상을 제공
  1. Quantized Action Consistency Reward(QACR)
  • 목적: 이산화된 행동 공간(Quantized Action Space)내에서 예측된 행동 토큰별 정확도를 평가함.
  • 동작 방식
    • 생성된 토큰에 대해 Fast+ Toknenizer 규격 준수 여부(Format Check)를 먼저 수행함.
    • 검증을 통과한 예측 Token Sequence a={au}=u=1Ua = \left\{a_u\right\}=^U_{u=1} 와 정답 토큰 시퀀스 a~={a~v}v=1V\tilde{a}=\{\tilde{a}_v\}_{v=1}^V
      QACR=l=1min(U,V)I(al=a~l)max(U,V)QACR = \frac{\sum_{l=1}^{\min(U,V)} \mathbb{I}(a_l = \tilde{a}_l)}{\max(U,V)}
  1. Continuous Trajectory Alignment Reward(CTAR)
  • 목적: 토큰 정확도를 넘어 실제 물리적 제어를 위해 디코딩된 연속 행동 청크와 Reference trajectory 간의 공간적 정렬을 평가함.

  • 동작 방식:

    • Token Sequence aa를 Fast+ Tokenizer로 디코딩하여 HH 길이의 연속 행동 청크 y=(ypose,ygrip)y=(y^{pose}, y^{grip})를 얻음.
    • 각 timestep tt에 대해 Pose 보상과 Grip 보상을 각각 산출함.
      • Pose Reward(rtposer_t^{pose}): 정답 Pose와의 L1 거리 dtd_t에 지수 감쇠를 적용하여 미세 오차에 민감하게 반응함(rtpose=exp(αdt)r_t^{pose} = \exp(-\alpha \cdot d_t)).
      • Grip Reward(rtgripr_t^{grip}): Gripper의 열림/닫힘 상태 일치 여부를 나타내는 이진(Binary) 지시함수 사용
  • 두 보상을 가중 합산 후 청크 길이 HH로 나누어 정규화함.

    CTAR=1Ht=1H(βrtpose+(1β)rtgrip)CTAR = \frac{1}{H} \sum_{t=1}^{H} \left( \beta \cdot r_t^{pose} + (1-\beta) \cdot r_t^{grip} \right)

  1. Format Compliance Reward(FCR)
  • 목적: VLA모델이 출력 차원 및 Chunk 크기 규격을 이탈하여 구문 오류(Structural invalidity)를 내는 현상을 방지함.
  • 동작 방식: Fast+ Tokenizer로 정상 디코딩 가능한 구문 구조를 만족하면 1, 그렇지 않으면 0을 부여하는 이진(Binary) 보상:
    FCR={1,if valid0,otherwiseFCR = \begin{cases} 1, & \text{if valid} \\ 0, & \text{otherwise} \end{cases}

3.3 Final Reward Synthesis

  • 세 가지 차원의 보상을 결합하여 최종 보상 rr을 구성함.
    r=ωQACR+(1ω)CTAR+λFCRr = \omega \cdot QACR + (1-\omega) \cdot CTAR + \lambda \cdot FCR
  • ω[0,1]\omega \in [0,1]: 이산 토큰 일치도(QACR)와 연속 궤적 정렬(CTAR) 간의 밸런스를 조절함.
  • λ\lambda: 구조적 포맷 준수(FCR)의 중요도를 스케일링함.

4. Experiments

4.1 Implementation Details

  • 기반 모델: NORA-Long을 Base VLA 모델로 사용하며, 행동 표현을 위해 Fast+ Tokenizer를 채택함.
  • 최적화 설정: RFT단계에서 전체 파라미터 미세조정(Full-parameter Optimization)을 진행함.
    • GRPO Rollout Group 크기(GG) : 8
    • Optimizer : AdamW(Learning rate 1×1061 \times 10^{-6}
  • Reward Hyperparameter : CTAR의 α=5,β=0.8\alpha=5, \beta=0.8 / 최종 보상 가중치 ω=0.7.λ=0.1\omega=0.7. \lambda=0.1
  • 하드웨어: NVIDIA H20 GPU 8

4.2 Multi-Task Learning Experiments

  • 실험 환경 및 데이터:
    • SimplerENV: WidowX (BridgeData V2) 및 Google Robot(Fractal) 플랫폼.
    • LIBERO : 4개 Task Suite(Object, Spatial, Goal, Long) 모든 task
    • Real-World(Franka): 4가지 실제 Task(Pick banana, Pick Bread, Pull Drawer, Hang Chinese Knot)
  • Results:
  • SimplerEnv: SFT 대비 WidowX에서 평균 +3.5%, Google Robot에서 평균 +4.4% 성공률 향상
  • LIBERO: 평균 성공률 95.6%를 달성하여 기존 discrete/continous action model을 모두 제치고 최고 성능 달성
  • Real-world : SFT 대비 평균 성공률 +8.7% 향상(특히 고난이도 "Hang Chinese Knot" Task에서 +15% 향상)

4.3 Continual Learning Experiments

  • Experiment Protocol:

    • Base Task Stage: 초기 6개의 Task 학습(Task 당 50개 Episode)
    • LifeLong Learning Stage: 순차적으로 4개 신규 Task 학습(Task 당 10개 Episode, 이전 Task 기억용 Replay 5개 유지)
    • Metrics: FWT(New Task 적응력 \uparrow), NBT(Forgetting 수준 \downarrow), AUC(전체 평균 성공률 \uparrow)
  • Results

    • LIBERO : 모든 Task Suite에서 Baseline(SFT 및 BC 기반 Continual Learning Model)을 압도

      • 특히 LIBERO-Goal에서 SFT eoql AUC 35.9 증가
    • Real-world : SFT 대비 FWT가 +23.7점 상승, NBT는 6.1로 낮게 유지하여 이전에 배운 기술의 Forgetting을 방지

4.4 Ablation Studies

  • Multi-Dimensional Process Reward 구성 요소별 검증
    • w/o CTAR: 연속 궤적 정렬 보상을 제거하면 평균 성공률이 90.9% 급락하여 과제 수행 능력을 거의 상실함.(가장 핵심)
    • w/o QACR: discrete token 일치 보상 제거 시 평균 성공률 2.8% 하락
    • w/o FCR: 포맷 준수 보상 제거 시 평균 성공률 2.6% 하락
  • Adaptation Efficiency(신규 Task 적응 효율성)
    • SFT 대비 현저히 적은 데모 수로 신규 Task에 빠르게 적응
    • 예: "Pick Orange juice"Task에서 SFT는 50개 Demo로 98%에 도달한 반면, LifeLong-RFT는 단 5개의 Demo만으로 100% 성공률 달성
profile
Robotics

0개의 댓글