[논문 리뷰] VITRA

마계닭·2026년 2월 24일

논문 리뷰

목록 보기
12/18

원제: Scalable Vision-Language-Action Model Pretraining for
Robotic Manipulation with Real-Life Human Activity Videos

1. Introduction

VLA Pre-training

  • VLA(Vision-Language-Action): 카메라나 센서 데이터 등 시각(Vision)정보와 자연어 명령(Language)을 통해 실제 환경에서 특정한 작업(Action)을 수행하도록 설계된 AI모델.

일반적으로 VLA데이터셋은 실험실 환경에서 teleoperation으로 수집된다. 이는 데이터의 가치는 매우 높지만, 수집 비용이 너무 높다는 단점이 존재한다.

웹 데이터의 사용

웹에는 일상적인 행동과 그에 따른 물리적 상호작용을 다루는 많은 실제 인간 영상이 존재한다. 그러나 이런 데이터들은

  • 대본이 존재하지 않음
  • 분할되어 있지 않음
  • 길이와 작업 세분성(작업을 나누는 단위)가 제각각임
  • 노이즈가 많고 목적에 관련 없는 행동도 많음
  • 언어적 지시나 3D 행동 레이블도 없음

이런 웹 데이터를 VLA 학습 데이터로 사용하기 위해, 사람의 손을 AI 모델의 End-Effector로 간주하고,

  • Task alignment: 기존 로봇 데이터의 구성 방식을 따름과 동시에 원자 수준의 단기작업을 분할하고 필터링해야 한다.
  • Label alignment: Dense Action Label을 제공하기 위해서 Metric Space 상에서 3D 손 움직임을 복원해야 한다. 실제 웹 데이터는 한 개의 카메라를 보정없이 움직이며 촬영하기에 난이도가 높다. 추가로 행동을 설명하는 Language Instrcution Label도 필요하다.

2. Related Works

VLA model pretraining

  • VL은 pretraining module이나 backbone을 통합: 대부분 OXE(Open X-Embodiment) 데이터 셋 활용.
  • Action은 proxy(대체 표현)을 활용함: latent action을 비지도 학습하고, 이를 proxy로 활용. 영상의 미래 프레임을 예측 대상으로 활용하기도 함.

Egocentric한 인간 영상에서 3D 손행동 레이블을 사용하여 사전학습을 진행하기도 하지만, 이는 통제된 환경에서 수집된 손-물체 상호작용 영상에만 의존한다.

Dexterous Hand Manipulation

기존에 손가락 로봇 손은 시뮬레이터에서 강화학습을 통해 학습되었다. 하지만 이는 보상 설계가 복잡하고, 실제 환경 적용성이 제한된다.
인간의 원격조작 시연 데이터를 이용한 imitation learning을 이용한 연구들도 존재하지만, 이는 소수의 작업에 특화된 모델이다.

Robot Learning from Human Videos

Egocentric한 인간 영상을 활용해 Vision 및 Language 표현을 학습한다.

  • 모션 캡쳐나 웹 영상의 명시적인 인간 행동을 Imitation Learning Framework에서 로봇 정책 학습에 사용
  • 명시적 움직임 대신 Affordance(객체가 제공하는 가능한 행동 가능성에 대한 정보), Point trajectories(영상 속 특정 점이 시간에 따라 이동하는 경로), hand-object mask(손과 물체 영역을 픽셀단위로 분할한 정보)를 학습한다.

Temporal Action Segmention for Videos

긴 인간 영상에서 행동 구간을 탐지하고 분류. 초기에는 정의된 행동 클래스에 대해서만 초점을 맞췄지만, 현재는 광범위한 행동 이해 능력을 갖춤. 하지만 여전히 정확도 측면에서 어려움이 존재함.

3. Transforming Human Hand Video to VLA Data

VLA Data: 간단하고 단기적인 작업으로 구성됨

  • High-level Planner: 원자단위의 행동을 목표를 위해 순서대로 계획하는 시스템. 이를 이용해 VLA Data의 단기 작업이 장기 작업으로 조합됨
  • 각 data episode는 언어 지시, 영상 프레임 시퀀스, end-effector의 3D Action chunk를 포함함

3D Motion Labeling

목표: 영상에서 두 손과 카메라의 움직임을 포함한 3D 움직임을 추출
1. Background Optical Flow: 카메라가 정지 상태인지 이동 중인지를 판별하는 알고리즘
2. 카메라 내부 파라미터(intrinsics) 추정

  • Moving인 경우 DroidCalib: 움직이는 영상의 내부 파라미터(초점 거리, 렌즈 왜곡, 카메라 중심 위치 등)추정
  • Static인 경우 MoGe-2(monocular 영상에서 깊이 및 기하 구조 추정), DeepCalib(정지 카메라 영상의 내부 파라미터 추정)
  • 왜곡이 큰 경우 왜곡 보정(Undistortion)

3. 손 재구성 및 카메라 자세 추정

  • 손 재구성(HaWoR): 프레임별 카메라 좌표계 3D 손 복원, 손목의 6D 자세와 MANA hand parametric model 기반의 관절 각도를 포함함
  • 카메라 자세 추정(MegaSAM): MoGE-2의 깊이 데이터를 바탕으로 깊이 추정 기반 SLAM 사용

4. 3에서 얻은 두 정보를 활용해 word-space의 3D 손 시퀀스를 얻은 후 spline smoothing과 outlier removal을 적용

spline smoothing: 노이즈가 포함된 데이터 점들을 부드러운 곡선으로 보정. interpolation과 달리 모든 점을 정확히 통과하지 않고 전체 추세를 부드럽게 근사

Atomic Action Segmentation

목표: 긴 영상에서 원자 수준 행동 시퀀스를 분리
실제 인간 손 행동의 자연스러운 beats를 이용: 사람은 행동 전환 시 손 속도 변화가 발생하며, 속도의 최소값이 행동의 전환 지점인 경우가 많음.

  • world space 손목 속도 최소값을 탐지해서 이를 분할 지점으로 사용
  • hand trajectory를 smooth해서 일정한 window 내 local speed minima를 선택

이때 좌우 손은 독립적으로 분할하고, 한 손의 움직임을 분석할 때 다른 손의 움직임은 무시한다.
추가 모델 추론이나 사전 텍스트 라벨 없이도 계산 효율성이 높다. 일부 행동에서는 over-segmentation이 발생할 수 있지만, 이후 언어 라벨링에서 병합된다.

Instruction Labeling

위 과정들을 통해 얻은 영상 분할과 3D 손 행동 시퀀스를 활용해 시각화 자료를 생성하고, GPT-4.1을 활용해 행동 캡션을 생성

  • 손 움직임 분석
  • 의미 있는 조작 여부 판단: 의미 없는 행동은 N/A로 라벨링
  • 자연어 명령형 설명 생성

이때 고정 길이 분할보단 원자 수준의 영상 클립이 캡션 정확도가 더 높다.

Hand V-L-A Dataset Construction

Ego4D, Epic-Kitchen, EgoExo4D, Something-Something-V2 등 Egocentric한 인간 영상 데이터셋을 처리하여 대규모 인간 손 V-L-A Dataset을 구축
기존의 라벨링은 모델의 요구 조건과 일치하지 않기에 사용하지 않는다.

4. Dexterous Hand VLA Model

VLA model π\pi, 현재 시간 관측 oto_t, 로봇의 proprioceptive state sts_t, language instruction ll, 미래의 end-effector 행동 시퀀스 aa
π:(l,ot,st)(at,at+1,...,at+N)\pi : (l,o_t,s_t) \rightarrow (a_t, a_{t+1}, ..., a_{t+N})

4.1 VLA 모델 설계

Model Architecture


VLM: PaliGemma-2(SigLIP encoder + Gemma-2 Language model)

  • FoV정보를 추가 토큰으로 입력(이미지 종횡비, 카메라 내부 파라미터 해석)
  • 학습 가능한 cognition token을 VLM입력에 추가: VLM의 출력이 매우 많고, Action expert에게 요약을 전달해주기 힘들기에 특정 장면을 한 벡터로 요약하는 토큰을 만듦
  • cognition token을 통해 생성된 하나의 특징 벡터 fcf_c를 Action expert condition으로 사용: Diffusion기반 행동 생성에서 denosing 과정 전체가 해당 지시에 맞는 행동으로 유도되도록 만듦

Action Expert: Diffusion Transformer(DiT)

  • 입력: fcf_c, 손의 상태 sts_t, noise가 추가된 action segment(ati,at+1i,...,at+Nia^i_t, a^i_{t+1},...,a^i_{t+N})
  • sts_t: 현재 영상에서 카메라 좌표계 손목 위치 및 회전, 손 관절 각도
  • 행동의 유효성 여부를 나타내는 action mask도 입력
  • fcf_c는 AdaLN을 통해 주입되어 조건 정보 강화
  • 학습: LMSE=EϵN(0,1),iϵ^iϵ2\mathcal L_{MSE}=E_{\epsilon \sim N(0,1),i}||\hat\epsilon_i - \epsilon||^2, 이때 ϵ^\hat\epsilon은 예측 노이즈, ϵ\epsilon은 실제 노이즈

Action expert, VLM, cognition token은 end-to-end로 학습되고, vision encoder은 frozen

Hand Action Space

시점 tt에서 행동 ata_t,
at=[Δtl,Δrl,θlh,Δtr,Δrr,θrh]R102a_t = [\Delta t_l,\Delta r_l, \theta ^h_l, \Delta t_r, \Delta r_r, \theta^h_r] \in \mathbb R^{102}
이때

  • ΔtR3\Delta t \in \mathbb R^3: 연속 프레임 간 손목 위치 변화
  • ΔrR3\Delta r \in \mathbb R^3: 손목 회전 변화(Euler angle)
  • θhR15×3\theta_h \in \mathbb R^{15 \times 3}: MANO 기반 15개 관절 각도
  • l, r은 왼손, 오른손

Unified Single and Dual-Hand Action Prediction

VLM은 항상
Left hand: <왼손 행동>
Right hand: <오른손 행동>
과 같은 형식으로 언어 지시를 입력받음
만약 해당 손 행동이 없다면 None

Action expert는 항상 양손 행동 노이즈를 입력받음
한 손 레이블만 존재할 경우 action mask를 action dimension에 맞춰 추가입력받는다. mask가 0이면 해당 행동은 0으로 설정 후 손실 계산에서 제외한다.

Causal Action Denoising

실제 인간의 손은 빠르게 움직이면서 pre-training data action clip은 약 1초 수준(30 frame)이기에 예측 길이를 16 frame정도로 잡게 되면 padding이 필요하다.
이때 단순히 0으로 패딩하면 부자연스럽기에 action denoising에 causal attention을 적용하고, 각 행동 토큰이 이전 행동만 참조하도록 제한한다.

4.2 Pretraining with Human Hand VLA Data

목표: 이전에 구축한 데이터셋을 이용하여 Pre-training 수행
일반화 능력 향상을 위해 trajectory-aware augmentation 적용

trajectory-aware augmentation: 일반적인 data augmenation을 적용하면 좌표와 이미지 간 불일치가 발생하기에, 이미지 변환과 동시에

  • 손의 3D위치 변환
  • 카메라 파라미터 재계산
  • 행동 벡터 변환

    을 동시에 수행한다.

구체적으로

  • random cropping
  • 시야각, 종횡비, 중심 변화 perspective 변환
  • 카메라 중심 유지
  • trajectory crop 영역 내부 유지
  • 이미지 좌우 반전 및 대응 행동, 언어 수정
  • 색상 정보가 없다면 color jitter 적용

4.3 Fine-tuning for Robotic Dexterous Manipulation

사전학습 후 로봇 데이터로 fine-tuning을 진행하여 실제 적용시킨다.

  • 로봇 end-effector 6D 자세를 활용해서 Δt\Delta tΔr\Delta r을 계산
  • 로봇 손의 관절을 사람 손 관절 topology 기반(θh\theta_h)에 대응하여 매핑
  • 대응이 안된다면 mask 0으로 패딩

5. Experiment

Pretraining Data Analysis

다양한 실제 생활 활동을 데이터로 이용할 때

  • Visual Diversity: 실험실에 한정된 데이터들에 비해서 실제 환경 데이터가 더 높은 장면 다양성을 보이고 일반화에 더 유리한 모습을 보임

    (h: 최소 h번 이상 등장한 단어가 h개 이상 존재할 때 최대 h값 / i100: 100번 이상 등장한 서로 다른 단어 개수)
  • Instruction Diversity: GPT-4.1을 활용해 지시문에서 명사, 동사, 형용사 분포를 확인했을 때 언어 표현 범위가 더 넓은 모습이 관찰됨

Human Hand Action Prediction

Pretraining된 VLA 모델이 보지 못한 환경에서 사람 손 행동을 제대로 예측하는가

  • 기존 모덷를보다 더 정확한 행동 예측이 가능했음
  • 데이터 다양성이 높을수록 성능이 증가
  • Explicit 3D 행동 예측 방식이 latent action보다 더 안정적임

Real-World Robot Dexterous Manipulation

실제 로봇에 적용시킨 결과

  • unseen setting에서 기존의 모델들에 비해 우수한 일반화가 이루어짐
  • 인간 손 VLA데이터가 다양할수록 실제 로봇 성능의 향상으로 이어짐
  • 인간 손 행동 예측 정확도와 로봇 조작 성공률 간 명확한 양의 상관관계가 보임

6. Discussion / 7. Conclusion

정해진 실험실 환경에서의 데이터 뿐 아니라 Egocentric한 인간 활동 영상을 활용하여 VLA model을 pretraining 할 수 있는 방법에 대한 설명이다.
실제로 이런 방식으로 pretraining된 모델들은 unseen환경에서 강력한 zero-shot 성능을 보임.

profile
뉴비

0개의 댓글