[논문 리뷰] BagelVLA: Enhancing Long-horizon Manipulation via Interleaved Vision-Language-Action Generation

두부김치·2026년 8월 5일

논문 리뷰

목록 보기
24/26

Title : BagelVLA: Enhancing Long-horizon Manipulation via Interleaved Vision-Language-Action Generation (RSS 2026)
논문 링크 : https://www.roboticsproceedings.org/rss22/p083.pdf
blog: https://cladernyjorn.github.io/BagelVLA.github.io/

1. Introduction

  • 연구 배경 및 필요성:

    • Goal of Generalist Robot: 비구조화된 환경에서 복잡한 조작(Manipulation)과제를 수행할 수 있는 Generalist Robot을 구현하려면 (1) Language Instruction 이해(언어 이해), (2) Future Image 예측(시각적 예측), (3) 필요한 동작 실행(행동 제어)의 3가지 핵심 능력이 필수적임.
    • 기존 VLA(Vision-Language-Action) 모델의 한계:
      • 기존 모델들은 이 세 가지 능력을 분리된 모듈로 처리하거나 일부에만 치중
      • 고수준 계획(High-level planning)에 집중하는 모델은 시각적 예측 능력이 부족하고, 시각적 예측에 집중하는 모델은 복잡한 과제 수행에 필요한 논리적 추론 능력이 떨어짐
      • 복잡하고 호라이즌이 긴(Long-horizon)과제를 해결하기 위해서는 추론, 예측, 제어를 하나로 매끄럽게 통합한 단일 프레임워크가 필요함.
  • Proposed Method: BagleVLA

    • Multimodal 사전학습 모델의 활용:
      • 최근 Text나 Image를 단일 트랜스포머 백본에서 동시에 처리/생성하는 모델(예: Bagel)이 등장함에 따라, 로봇이 텍스트로 "생각(think)"하고 픽셀 단위로 결과를 "상상(Imagine)"할 수 있는 강력한 prior를 활용할 수 있게 됨.
    • Interleaved Generation(교차 생성)도입:
      • BagelVLA는 언어적 계획(Liguistic Planning), 시각적 예측(Visual forecasting), 행동 생성(Action Generation)을 하나의 단일 Transformer 아키텍처 내에서 교차(interleave)하여 수행함.
      • 작동 루프: global 지시가 입력되면 텍스트 계획 생성(하위 과제 분해) \rightarrow 미래 시각 상태 예측(결과 상상) \rightarrow 이를 바탕으로 행동(Action) 생성의 순서로 Logic
  • 주요 기술적 과제 및 해결 방안

    • Two-Stage Training Strategy:
      • Stage 1:일반 다중모달 데이터와 다양한 로봇 데이터셋을 결합하여 모델이 일반적 추론 및 시각적 예측 능력을 로봇 제어 영역(Embodied Setting)으로 전이하도록 선학습.
      • Stage 2: Action Expert 모듈을 도입하고 전체 모델을 Fine-tunning하여 언어, 예측된 시각적 동역학(Visual dynamics), 로봇 제어를 밀접하게 결합함.
    • Residual Flow Guidance(RFG):
      • 이미지 생성(시각적 예측) 시 발생하는 High Latency 문제를 해결하기 위한 기법
      • 전체 장면을 매번 새로 합성하는 대신, 현재 관찰(Observation)에서 시작하여 단일 단계 디노이징(Single-step denoising)을 통해 행동에 의해 발생하는 변화량(Residual changes)에만 집중함으로써 예측 비용과 지연 시간을 획기적으로 줄임.
  • Contribution

    • 단일 통합 프레임워크 제안: 언어적 계획, 시각적 예측, 행동 생성을 단일 아키텍처로 통합하여, 언어에서 시각적 동역학으로 이어지는 전이를 명시적으로 모델링함으로써 Long-horizon tasks에서의 추론 및 제어 능력을 향상시킴
    • Residual Flow Guidance(RFG) 제안: 현재 관찰을 구조적 사전 정보로 활용하고 Single-step Denoising을 적용하여, 최소한의 지연 시간으로 미래 시각 동역학을 포착하는 효율적인 행동 표현법을 제안.
    • 시뮬레이션 및 실제 환경 실험을 통해 기존 베이스라인 대비 월등한 성능을 보임. Unseen instruction 및 다양한 물체 배치 환경에서도 강력함 Generalization을 입증함.

2. Methodology

2.1 Preliminaries: Interleaved planning for Robot Control

  • 문제 정의: 기존 VLA모델은 전체 Instruction LL과 현재 Observation vtv_t로부터 직접 행동 ata_t를 매핑하는 방식 (pθ(atvt,L)p_\theta(a_t\vert{}v_t, L))을 사용했으나, 복잡한 Long-horizon 과제에서는 한계가 있음.
  • Causal Chain factorization: BagelVLA는 이를 해결하기 위해 문제 구조를 3단계의 Interleaved Planning(교차 계획)으로 factorization 하여 공동 확률 분포 pθ(at,vt+k,ltvt,L)p_\theta(a_t, v_{t+k}, l_t \vert{} v_t, L)를 모델링
    1. Linguistic Planning(언어적 계획): 전체 Instruction LL로부터 현재 실행해야 할 Subtask ltl_t를 식별함.
    2. Visual Forecasting(시각적 예측): 하위 목표 ltl_t 조건에 따라 미래의 물리적 결과 Keyframe vt+kv_{t+k}를 예측함.
    3. Action Gerneration(행동 생성): 언어적 계획(ltl_t)와 시각적 예측(vt+kv_{t+k})모두에 기반하여 연속적인 Robot Action Chunk ata_t를 생성
  • 학습 목표: 세 단계의 likelihood 합을 최대화하는 방향으로 Loss Function(J=(Ll+Lv+La)\mathcal{J} = -(\mathcal{L}_l + \mathcal{L}_v + \mathcal{L}_a))를 구성함.

2.2 Data Engine

  • Pretrain 및 Fine-tuning을 위해 4가지 카테고리의 대규모 다중모달/로봇 데이터셋을 구축하고 가공
  • Robot Data(로봇 데이터):
    • Self-collect Data(Proprietary)는 직접 subtask(ltl_t)와 Keyframe을 annotation함.
    • 공개 데이터셋(Public)은 Seed-1.5-VL-thinking모델을 활용해 ltl_t를 합성하고 시작/끝 프레임 경계를 자동으로 추출 후 필터링.
  • General Data(일반 데이터):
    • 인간의 1인칭 시점 비디오(Egocentric Human Video) 및 대규모 VQA 데이터(LLaVA, FineVision 등)를 활용함.
    • 인간 비디오의 경우 시각적 동역학만 학습하도록 마지막 프레임을 예측하는 용도로 사용되며, 기저 모델의 언어 이해/생성 능력을 유지하는 역할을 함.

2.3 Model Architecture

  • BagelVLA는 MoT(Mixture of Transformer) 구조로 채택하여 3가지 Modality 전용 Expert Network를 Self-Attention으로 연결함.
  1. Understanding Expert & Generation Expert(7B)
  • 기반 모델: Qwen2.5-LLM-7B 아키텍처 기반의 Bagel 모델로 초기화함.
  • 인코더: 관찰 이미지(vtv_t)는 SigLIP2를 통해 ViT 토큰으로, Visual 생성용 이미지는 FLUX VAE를 통해 VAE 토큰으로 인코딩됨.
  • Loss Function: 언어 계획은 Cross-Entropy(CE) Loss Ll\mathcal{L}_l을 사용하며, Visual Prediction은 Flow Matching(FM) Loss Lv\mathcal{L}_v를 사용하며 VAE 노이즈를 반복적으로 제거
  1. Action Expert(2B):
  • Robot Proprioception 및 Action Modality를 담당하는 별도의 Transformer
  • Qwen2.5 아키텍처 기반이지만, MLP 중간 크기를 1/5로 축소한 2B 파라미터 구조로, 추론 시 KV-Cache 활용 및 고주파수 실시간 제어가 가능
  • Flow Matching Loss La\mathcal{L}_a을 통해 Action Chunk를 생성하며, Gen Expert가 De-Noising중인 이미지의 Middle Latent State에 Attend

2.4 Conditioning Schemes in Dual Flow-Matching

  • 시각 예측과 행동 생성이라는 두 가지 Flow Matching 모듈 간의 정보 교환 방식을 3가지로 모색함.
  1. Scheme 1: Complete Denoise:
  • Gen Expert가 Keyframe 이미지를 완전히 DeNoising(N1N_1 단계)한 후 그 결과를 Action Expert 입력으로 제공(총 N1+N2N_1 + N_2 단계 필요, 추론 지연 시간 길고 시각적 오류가 누적될 위험이 있음.)
  • Scheme 2: Joint Denoise
    • Keyframe과 Action의 DeNoising을 NN 단계 동안 동기화하여 동시에 수행. Action Expert는 DeNoising 중인 Noise 상태의 Keyframe에 접근함.
  • Scheme 3: Single-Step Denoise
    • 행동 생성이 Keyframe Denoise의 첫 번째 단계에서 생성된 KV-Cache에만 조건화되어 생성
    • Residual Flow Guidance(RFG)
      • 초기 Noise를 단순 가우시안 Noise(N(0,I)\mathcal{N}(0, I)) 대신 현재 관찰 이미지(vtv_t)를 사전 정보로 포함한 Noise(N(vt,I)\mathcal{N}(v_t, I))로 설정함.
      • 모델이 정적인 배경 대신 로봇 조작에 따른 동적 변화량(Residual changes)에 집중하도록 하여 단 몇 단계만으로 고품질 예측이 가능하고 추론 속도가 대폭 향상됨.

2.5 Training and Inference Strategy

  • Two-Stage Training
    • Stage 1: Pretraining: 행동 라벨 없이 일반 VQA, Human Video, Robot dataset을 사용해 Und Expert, Gen Expert만 Fine tuning하여 텍스트 계획 및 시각적 동역학 예측 능력을 학습시킴
    • Stage 2: Finetuning: 행동 라벨이 포함된 Downstream Robot data를 도입하여 Action Expert를 포함한 전체 모델을 동시에 학습
  • Inference Strategy
    • 추론 시 텍스트 계획 \rightarrow Keyframe \rightarrow Action을 순차 교차 방식으로 생성
    • Single-step Denoise와 단일 RTX 5090 GPU환경을 기준으로 1.2초당 48개 action chunk(실제 제어 주파수 40Hz)를 생성할 수 있음.
    • 비동기 실행(Asynchronous Execution): 학습 중 현재 프레임을 이전 프레임으로 임의 교체하는 기법을 적용하여 Und/Gen Expert의 KV context 업데이트 주기를 낮추고 로봇 상태만 빠르게 갱신함으로서 최대 72Hz의 높은 주파수 제어를 달성함.

3. Experiments

3.1 Evaluation in Simulation Environment

  • 시뮬레이션 벤치마크인 Calvin과 Robotwin 2.0에서 기존 SOTA모델들(π0\pi_0, RDT, UP-VLA, VPP)과 비교 평가를 진행함.
  • Calvin(ABC \rightarrow D 환경)
    • BagelVLA는 평균 연속 과제 완료 길이(Average Completion Length) 4.41을 기록하며 최고 성능을 달성함.
    • 이는 시각적 예측을 보조 학습으로 활용하는 기법이 배경 및 색상 변화와 같은 분포 외(OOD)환경에서도 높은 제어 정밀도를 유지하도록 돕는다는 점을 보여줌.
  • RoboTwin 2.0 (50개 과제)
    • Clean 환경: BagelVLA는 75.26%의 성공률로 SOTA 성능을 기록함.(textual-planning을 사용하지 않았으례때 54.0%)
    • Randomized (OOD) 환경: 20.87%의 성공률을 기록하며 강력한 도메인 무작위화 환경에서도 가장 뛰어난 성능을 보임.
    • Textual Planning 모듈을 결합했을 때 성공률이 대폭 상승하여, Interleaved Planning의 유효성 입증

3.2 Real-World Experiments

  • AgileX Bimanual robot platform 에서 Basic Tasks 및 Long-horizon Planning tasks를 평가
  1. Basic Task Experiments
  • Average Success: BagelVLA는 75.5%를 기록하며 π0\pi_0(65.0%) 및 VPP(59.5%)를 크게 앞섬
  • Unseen Pick & Place: 85% 의 성공률을 기록함. 사전학습으로 축적된 풍부한 visual-language Semantic Feature 덕분에 OOD 조건에서도 뛰어난 일반화 능력을 보임.
  1. Long-horizon Planning Task Experiments
  • 요청 순서대로 큐브 쌓기(Stack Cubes): Easy 95%, Middle 65%, Hard 60%를 기록하며 평균 73.3%의 높은 성공률을 달성함.
  • 수식 계산 및 기호 블록 배치(Calculate and Place Symbol Blocks): VLM의 산술 연산 능력(CoT Inference)을 활용해 결과를 계산한 뒤 행동으로 연결하는 과제로, 평균 63.3%의 성공률을 보임.
  • 계획 정확도(Planning Accuracy): Subtask 추론의 정확도가 약 90%에 달해, multimodla planning 능력이 매우 정확함을 입증함.

3.3 Ablation Study

  • Dual Flow-Matching 조건화 방식 비교:
    • Complete / Joint Denoise vs Single-step Denoise: Single-Step Denoise가 추론 속도(Chunk당 1.41초)와 Calvin ABC-D Score에서 모두 우수함.
    • Complete / Joint Denoise 방식은 OOD 환경에서 Denoise 중간 상태가 분포를 벗어나 성능 저하가 발생하는 반면, 단일 단계 방식은 이러한 오차 누적을 방지함.

  • RFG(Residual Flow Guidance)의 우수성:
    • 순수 가우시안 노이즈에서 시작하는 Naive Single-Step Denoise 대비, 현재 프레임을 입력 노이즈에 주입하는 RFG가 실 로봇 과제 전반에서 훨씬 높은 성공률을 나타냄
    • 단 10단계의 Denoise만으로도 Static 배경을 유지하면서 동적 변화 부분에 집중된 고품질 미래 Keyframe을 예측해냄.

  • 대규모 사전학습의 효과

    • 사전학습을 거치지 않은 모델(w/o pretrain)대비 사전학습된 본 모델이 OOD 과제 및 Medium-horizon 과제에서 현저히 높은 성공률을 보임
  • 언어 및 시각 modality 기여

    • w/o Textual-planning: Robotwin 환경 성공률 및 실전 장기 과제 성능이 크게 하락하여, 복잡한 과제 분해에 언어 추론이 필수적임을 확인함,
    • 시각적 예측 미사용(w/o Keyframe-forecasting): 제어 정밀도 및 모션 경향성 정확도가 하락하여, 시각적 동역학 예측이 제어 정책의 가이드 역할을 충실히 수행함을 확인함.

4. Conclusion

  • 단일 Transformer 시스템 내에서 Linguistic Planning, Visual Forecasting, Action generation을 Interleave하여 수행하는 단일 Vision-Language-Action 모델인 BagelVLA를 제안
profile
Robotics

0개의 댓글