Title : BagelVLA: Enhancing Long-horizon Manipulation via Interleaved Vision-Language-Action Generation (RSS 2026)
논문 링크 : https://www.roboticsproceedings.org/rss22/p083.pdf
blog: https://cladernyjorn.github.io/BagelVLA.github.io/
1. Introduction

2. Methodology
2.1 Preliminaries: Interleaved planning for Robot Control
- 문제 정의: 기존 VLA모델은 전체 Instruction L과 현재 Observation vt로부터 직접 행동 at를 매핑하는 방식 (pθ(at∣vt,L))을 사용했으나, 복잡한 Long-horizon 과제에서는 한계가 있음.
- Causal Chain factorization: BagelVLA는 이를 해결하기 위해 문제 구조를 3단계의 Interleaved Planning(교차 계획)으로 factorization 하여 공동 확률 분포 pθ(at,vt+k,lt∣vt,L)를 모델링
- Linguistic Planning(언어적 계획): 전체 Instruction L로부터 현재 실행해야 할 Subtask lt를 식별함.
- Visual Forecasting(시각적 예측): 하위 목표 lt 조건에 따라 미래의 물리적 결과 Keyframe vt+k를 예측함.
- Action Gerneration(행동 생성): 언어적 계획(lt)와 시각적 예측(vt+k)모두에 기반하여 연속적인 Robot Action Chunk at를 생성
- 학습 목표: 세 단계의 likelihood 합을 최대화하는 방향으로 Loss Function(J=−(Ll+Lv+La))를 구성함.
2.2 Data Engine
- Pretrain 및 Fine-tuning을 위해 4가지 카테고리의 대규모 다중모달/로봇 데이터셋을 구축하고 가공
- Robot Data(로봇 데이터):
- Self-collect Data(Proprietary)는 직접 subtask(lt)와 Keyframe을 annotation함.
- 공개 데이터셋(Public)은 Seed-1.5-VL-thinking모델을 활용해 lt를 합성하고 시작/끝 프레임 경계를 자동으로 추출 후 필터링.
- General Data(일반 데이터):
- 인간의 1인칭 시점 비디오(Egocentric Human Video) 및 대규모 VQA 데이터(LLaVA, FineVision 등)를 활용함.
- 인간 비디오의 경우 시각적 동역학만 학습하도록 마지막 프레임을 예측하는 용도로 사용되며, 기저 모델의 언어 이해/생성 능력을 유지하는 역할을 함.
2.3 Model Architecture

- BagelVLA는 MoT(Mixture of Transformer) 구조로 채택하여 3가지 Modality 전용 Expert Network를 Self-Attention으로 연결함.
- Understanding Expert & Generation Expert(7B)
- 기반 모델: Qwen2.5-LLM-7B 아키텍처 기반의 Bagel 모델로 초기화함.
- 인코더: 관찰 이미지(vt)는 SigLIP2를 통해 ViT 토큰으로, Visual 생성용 이미지는 FLUX VAE를 통해 VAE 토큰으로 인코딩됨.
- Loss Function: 언어 계획은 Cross-Entropy(CE) Loss Ll을 사용하며, Visual Prediction은 Flow Matching(FM) Loss Lv를 사용하며 VAE 노이즈를 반복적으로 제거
- Action Expert(2B):
- Robot Proprioception 및 Action Modality를 담당하는 별도의 Transformer
- Qwen2.5 아키텍처 기반이지만, MLP 중간 크기를 1/5로 축소한 2B 파라미터 구조로, 추론 시 KV-Cache 활용 및 고주파수 실시간 제어가 가능
- Flow Matching Loss La을 통해 Action Chunk를 생성하며, Gen Expert가 De-Noising중인 이미지의 Middle Latent State에 Attend
2.4 Conditioning Schemes in Dual Flow-Matching

- 시각 예측과 행동 생성이라는 두 가지 Flow Matching 모듈 간의 정보 교환 방식을 3가지로 모색함.
- Scheme 1: Complete Denoise:
- Gen Expert가 Keyframe 이미지를 완전히 DeNoising(N1 단계)한 후 그 결과를 Action Expert 입력으로 제공(총 N1+N2 단계 필요, 추론 지연 시간 길고 시각적 오류가 누적될 위험이 있음.)
- Scheme 2: Joint Denoise
- Keyframe과 Action의 DeNoising을 N 단계 동안 동기화하여 동시에 수행. Action Expert는 DeNoising 중인 Noise 상태의 Keyframe에 접근함.
- Scheme 3: Single-Step Denoise
- 행동 생성이 Keyframe Denoise의 첫 번째 단계에서 생성된 KV-Cache에만 조건화되어 생성
- Residual Flow Guidance(RFG)
- 초기 Noise를 단순 가우시안 Noise(N(0,I)) 대신 현재 관찰 이미지(vt)를 사전 정보로 포함한 Noise(N(vt,I))로 설정함.
- 모델이 정적인 배경 대신 로봇 조작에 따른 동적 변화량(Residual changes)에 집중하도록 하여 단 몇 단계만으로 고품질 예측이 가능하고 추론 속도가 대폭 향상됨.
2.5 Training and Inference Strategy
- Two-Stage Training
- Stage 1: Pretraining: 행동 라벨 없이 일반 VQA, Human Video, Robot dataset을 사용해 Und Expert, Gen Expert만 Fine tuning하여 텍스트 계획 및 시각적 동역학 예측 능력을 학습시킴
- Stage 2: Finetuning: 행동 라벨이 포함된 Downstream Robot data를 도입하여 Action Expert를 포함한 전체 모델을 동시에 학습
- Inference Strategy
- 추론 시 텍스트 계획 → Keyframe → Action을 순차 교차 방식으로 생성
- Single-step Denoise와 단일 RTX 5090 GPU환경을 기준으로 1.2초당 48개 action chunk(실제 제어 주파수 40Hz)를 생성할 수 있음.
- 비동기 실행(Asynchronous Execution): 학습 중 현재 프레임을 이전 프레임으로 임의 교체하는 기법을 적용하여 Und/Gen Expert의 KV context 업데이트 주기를 낮추고 로봇 상태만 빠르게 갱신함으로서 최대 72Hz의 높은 주파수 제어를 달성함.
3. Experiments

3.1 Evaluation in Simulation Environment
- 시뮬레이션 벤치마크인 Calvin과 Robotwin 2.0에서 기존 SOTA모델들(π0, RDT, UP-VLA, VPP)과 비교 평가를 진행함.
- Calvin(ABC → D 환경)
- BagelVLA는 평균 연속 과제 완료 길이(Average Completion Length) 4.41을 기록하며 최고 성능을 달성함.
- 이는 시각적 예측을 보조 학습으로 활용하는 기법이 배경 및 색상 변화와 같은 분포 외(OOD)환경에서도 높은 제어 정밀도를 유지하도록 돕는다는 점을 보여줌.
- RoboTwin 2.0 (50개 과제)
- Clean 환경: BagelVLA는 75.26%의 성공률로 SOTA 성능을 기록함.(textual-planning을 사용하지 않았으례때 54.0%)
- Randomized (OOD) 환경: 20.87%의 성공률을 기록하며 강력한 도메인 무작위화 환경에서도 가장 뛰어난 성능을 보임.
- Textual Planning 모듈을 결합했을 때 성공률이 대폭 상승하여, Interleaved Planning의 유효성 입증

3.2 Real-World Experiments
- AgileX Bimanual robot platform 에서 Basic Tasks 및 Long-horizon Planning tasks를 평가
- Basic Task Experiments
- Average Success: BagelVLA는 75.5%를 기록하며 π0(65.0%) 및 VPP(59.5%)를 크게 앞섬
- Unseen Pick & Place: 85% 의 성공률을 기록함. 사전학습으로 축적된 풍부한 visual-language Semantic Feature 덕분에 OOD 조건에서도 뛰어난 일반화 능력을 보임.
- Long-horizon Planning Task Experiments
- 요청 순서대로 큐브 쌓기(Stack Cubes): Easy 95%, Middle 65%, Hard 60%를 기록하며 평균 73.3%의 높은 성공률을 달성함.
- 수식 계산 및 기호 블록 배치(Calculate and Place Symbol Blocks): VLM의 산술 연산 능력(CoT Inference)을 활용해 결과를 계산한 뒤 행동으로 연결하는 과제로, 평균 63.3%의 성공률을 보임.
- 계획 정확도(Planning Accuracy): Subtask 추론의 정확도가 약 90%에 달해, multimodla planning 능력이 매우 정확함을 입증함.

3.3 Ablation Study
- Dual Flow-Matching 조건화 방식 비교:
- Complete / Joint Denoise vs Single-step Denoise: Single-Step Denoise가 추론 속도(Chunk당 1.41초)와 Calvin ABC-D Score에서 모두 우수함.
- Complete / Joint Denoise 방식은 OOD 환경에서 Denoise 중간 상태가 분포를 벗어나 성능 저하가 발생하는 반면, 단일 단계 방식은 이러한 오차 누적을 방지함.

- RFG(Residual Flow Guidance)의 우수성:
- 순수 가우시안 노이즈에서 시작하는 Naive Single-Step Denoise 대비, 현재 프레임을 입력 노이즈에 주입하는 RFG가 실 로봇 과제 전반에서 훨씬 높은 성공률을 나타냄
- 단 10단계의 Denoise만으로도 Static 배경을 유지하면서 동적 변화 부분에 집중된 고품질 미래 Keyframe을 예측해냄.

-
대규모 사전학습의 효과
- 사전학습을 거치지 않은 모델(w/o pretrain)대비 사전학습된 본 모델이 OOD 과제 및 Medium-horizon 과제에서 현저히 높은 성공률을 보임
-
언어 및 시각 modality 기여
- w/o Textual-planning: Robotwin 환경 성공률 및 실전 장기 과제 성능이 크게 하락하여, 복잡한 과제 분해에 언어 추론이 필수적임을 확인함,
- 시각적 예측 미사용(w/o Keyframe-forecasting): 제어 정밀도 및 모션 경향성 정확도가 하락하여, 시각적 동역학 예측이 제어 정책의 가이드 역할을 충실히 수행함을 확인함.

4. Conclusion
- 단일 Transformer 시스템 내에서 Linguistic Planning, Visual Forecasting, Action generation을 Interleave하여 수행하는 단일 Vision-Language-Action 모델인 BagelVLA를 제안