[논문 리뷰] EgoVLA

마계닭·2026년 3월 4일

논문 리뷰

목록 보기
14/18

원제: EgoVLA: Learning Vision-Language-Action Models
from Egocentric Human Videos

1. Introduction

Robotic Manipulation Data

  • 관절 매핑 기반 teleoperation tools: 사람이 컨트롤러나 장치를 조종 후 사람의 관절 움직임을 로봇 관절에 직접 매핑
  • Exoskeleton: 사람 몸에 기계 장치를 착용
  • VR device: 가상 환경에서 로봇을 원격 조작
  • 로봇 장비와 숙련된 조작자가 필요하다는 단점이 존재함

인간의 영상을 통한 Manipulation Data

  • Hand-Object Interaction: 인간의 시선은 다음 행동의 의도를 드러냄
    - 인간의 시선을 이용해 손과 물체의 상호작용을 예측하거나 생성
    - 인간의 조작 의도를 장기적으로 예측할 수 있음
  • 학습 데이터의 양을 크게 늘릴 수 있음 + 작업과 환경의 다양성 증가

EgoVLA

  • 인간의 action space와 로봇의 action space간 차이는 크지 않으며 기하학적 변환을 통해 근사할 수 있음
    - 시각 관측 프레임, 언어 지시, 현재 손 자세를 입력으로 주면 몇 단계 미래의 인간 동작을 예측함
    • 손목 위치: Inverse Kinematics
    • 인간 손 관절: retargeting
  • 일부 예측 오류가 존재함
    • 이는 소량의 teleoperation data로 fine-tuning하여 보정 가능

2. Related Work

Dexterous Manipulation

초기 연구

  • Control-Based Method
    • 학습이 아닌 물리 법칙과 수학적 모델을 이용해 로봇 제어
      • Inverse Kinematics: 목표 위치를 주면 로봇 관절 각도 생성
      • Grasp Planning: 물체를 잡기 위한 손가락 위치와 힘 계산
    • 정밀한 조작은 가능하지만, 일반화 능력이 제한적
  • Learning-Driven Approaches
    • Pose Vector: 로봇 손의 자세를 직접 벡터 형태로 생성
    • Intermediate Represnetations: 중간 단계의 표현만 먼저 예측
    • Contact Maps: 손과 물체 사이의 접촉 위치를 먼저 예측

Egocentric Human Video

  • 특정 작업에 대한 정책 학습
    • 일반적 작업이 아닌 작업이 한정되어있다는 한계

VLA(Vision-Langauge-Action)

VLMs를 대규모 로봇 데이터로 fine-tuning

  • perception과 action 통합
  • 데이터 요구량이 매우 큼
    • 대규모 teleoperation data
    • 스크립트 기반 실행 데이터

Egocentric Vision

기존의 한계

  • 데이터 규모와 다양성의 부족
  • 복잡한 데이터 셋: 현재 로봇이 수행하기 어려운 활동들
  • 단순한 데이터 셋: hand pose와 같은 정밀한 annotation이 부족

Learning from In-the-Wild Video

자연 환경의 영상

  • Affordance, 상호작용 단서 추출
  • 인간 영상을 이용해 표현을 pre-train하고 transfer이 가능
  • 대부분 비지도 학습에만 초점을 둠

3. Learning Manipulation Skills from Ego-Centric Human Videos

Datasets

Language model과 VLMs에서 알 수 있듯, 데이터셋 구조가 모델의 성능에 큰 기여를 한다.

데이터셋 조건: 조작 행동을 포함하는 egocentric video + pose annotations

  • Egocentric RGB observations
  • wrist pose
  • hand pose
  • camera pose

실제 데이터셋

  • HOI4D: 한 손 조작 작업
    • pick-and-place
    • re-orientation
    • articulated object interaction: 문, 서랍 등을 회전하거나 미는 동작
  • HOI3D: 33개의 rigid objects와 상호작용
  • HoloAssist: 양손 상호작용
    • 배터리 교체, 가구 조립, 기계 설정 등
    • 노이즈는 많지만 양손 상호작용을 풍부하게 포함
    • 다른 데이터셋에 비해 데이터가 많기에(166시간) 10% 균등 샘플링
  • TACO: tool-action-object

Data Processing: Egocentric video는 카메라가 움직이기에 학습이 어려움

  • World frame에서 미래 손목 위치를 계산하고, 이를 현재 카메라 기준으로 변환하여 사용

EgoVLA Model

base

  • backbone: NVILA-2B
    • Vision-Language 이해 능력이 높아서 intention inference에 좋음
    • 비교적 작은 모델 크기로 fine-tuning에 좋음
  • 입력
    • 현재 및 과거의 egocentric 시각 관측: head camera시점 6 frame
      • Visual Observation: 0.2초 간격 sampling(총 1초의 과거)
    • Language Instruction: High-level이 아닌 즉각적인 행동 지시
    • Action Query Tokens: 행동을 예측하도록 요청하는 special tokens
    • Human Proprioception: 손목의 이동, 회전, 손 자세
    • 해당 입력들을 backbon에서 인코딩하여 action head로 처리

Action Representation

정보

  • 손목 자세
    • 3D translation
    • rot6D rotation
  • hand joint angles
    • MANO hand model: 상위 15개 PCA 성분

학습(regression)

  • 미래 손목 자세, 손 관절 파라미터
  • L=λwrist_transLwrist_trans+λwrist_rotLwrist_rot+λjointLjointL = \lambda_{wrist\_trans}L_{wrist\_trans}+\lambda_{wrist\_rot}L_{wrist\_rot}+\lambda_{joint}L_{joint}

Action Head & Action Query Tokens

구성

  • 6개의 encoder layer
  • hidden size 1536

input

  • 인간/로봇의 proprioception state
  • action query token의 latent embedding

output

  • 미래 행동 시퀀스
  • At=[at,at+1,...,at+H]A_t = [a_t, a_{t+1}, ..., a_{t+H}]

Prediction Range

  • 1초 미래(30 future steps at 30 Hz)

Action Query Token

  • vocabulary의 마지막 30개의 word ID

Training Details

  1. 인간 데이터 pre-training
  • Ego-Centric Human Manipulation Datasets, 20epochs
  1. 로봇 데이터 post-training
  • 115 epochs, 100 epoch 이후 learning rate 감소

Transferring EgoVLA to Humanoid Robot

사람과 휴머노이드 모두 두 팔과 손을 이용한다는 점은 동일하지만, 카메라의 위치, 손의 형태, 시각적 외형의 차이로 인해 바로 적용은 힘듦

  • 소량의 로봇 데이터를 이용해 fine-tuning
  • 이땐 Unified Action Space를 활용

Retargeting robot data to human representation

로봇의 action space를 인간의 action representation으로 변경하여 정렬

  • end-effector pose: 3D 변환으로 로봇과 인간의 좌표계 정렬
  • hand configuration: MANO hand model parameter
    • minΘL(Θ)=15i=15SmoothL1(Jpred(Θ)i,jobs,i)\displaystyle min_{\Theta}L(\Theta) = {{1}\over{5}}\displaystyle \sum^5_{i=1} SmoothL1(J_{pred}(\Theta)_i, j_{obs, i})
    • ΘR15\Theta \in \mathbb R^{15}: MANO 손 파라미터
    • Jpred(Θ)J_{pred}(\Theta) MANO forward kinematics로 게산된 손가락 끝
    • JobsR5×3J_{obs} \in \mathbb R^{5 \times 3} 로봇 손가락 끝 실제 위치

Mapping human hand to robot hand

Inference: EgoVLA가 예측한 손목, 손 자세를 robot actuerator instructure

  • 예측한 손목 자세 -> 3D 변환으로 End-effector로 변환 -> Inverse Kinematics로 로봇 팔 관절 계산

손 동작 변환

  • 예측된 MANO 파라미터로 3D 손 keypoint 계산
  • MLP 모델이 손 keypoint로 로봇 손 관절 명령 예측
    • MLP는 로봇 시연 데이터로 학습
  • 원래 시연 데이터로도 정상적으로 수행되며, 작은 오차가 큰 영향을 주진 않음

4. Ego Humanoid Manipulation Benchmark

필요성

실제 로봇 실험의 문제

  • 비용이 매우 비쌈
  • 실험 시간이 오래 걸림
  • 실험 환경을 동일하게 재현하기 어려움
  • 안전 문제

이에 시뮬레이션 기반 평가를 많이 사용함
해당 벤치마크는 sim2real transfer보단 통제되고 재현 가능한 테스트 환경으로 시뮬레이션 활용

Short Horizon Tasks(단일 동작 중심)

  • Push-Box, Filp-Mug, Pour-Balls, Close-Drawer, Open-Drawer, Open-Laptop, Stack-Can

Long Horizon Tasks(여러 단계 행동 결합)

  • Sort-Cans, Insert-Cans, Unload-Cans, Insert-And-Unload-Cans, Stack-Can-Into-Drawer

Observation & Action Space

벤치마크 관측 정보

  • robot joint position
  • end-effector poses
  • contact force
  • egocentric RGB-D visual input

EgoVLA

  • Egocentric 시각 정보
  • End-effector pose
  • hand joint actuation
  • task descriptions

로봇 제어

  • 팔: end-effector control
  • 손: PD joint control
    • 6개의 active, 6개의 mimic joints -> 12개의 DoFs

      PD control: 목표 관절 위치에 도달하도록 오차를 이용해 힘 계산
      τ=Kp(qtargetq)+Kd(q˙targetq˙)\tau = K_p(q_{target} - q) + K_d(\dot q_{target}- \dot q)
      qq는 위치, q˙\dot q는 관절 속도

최종적으로 36차원 action space

  • arm inverse kinematics
  • direct hand actuation
  • Control frequency = 30Hz
  • 각 작업마다 매 단계 성공 여부, sub-task 완료 여부 확인

Diverse Visual Background

5개의 방, 5개의 테이블 텍스쳐 = 25개의 시각적 환경

  • Generalization 성능 평가

Demonstrations

Imitation Learning을 지원하기 위해 전문가 데이터 제공

  • teleoperation system으로 수집
  • Room 1, 2, 3, Table 1
  • 총 100개의 성공 시연

5. Experiments

Human Manipulation Modeling

인간 손 움직임을 얼마나 잘 모델링하는가

  • 인간 손목과 미래 위치 예측 오차는 약 8cm
  • 언어 지시의 변경에 따라 경로도 정상적으로 변경됨
  • 행동 뒤에 있는 semantic intent도 정상적으로 학습함

Evaluation

평가 지표

  • Success Rate(SR): 작업을 완전히 성공한 비율
  • Progress Rate(PSR): 전체 단계 중 얼마나 많은 단계까지 수행했는지

Baseline

  • EgoVLA: 인간 영상 사전 학습 + 로봇 데이터 fine-tuning
  • EgoVLA-NoPretrain: 로봇 데이터만 학습
  • ACT: 각 작업마다 따로 학습되는 전문 모델

Evaluation Setup

  • Seen environment: 학습에서 본 환경
  • Unseen environment: 완전히 새로운 환경(일반화 평가)

Result


1. 인간 데이터 pretraining이 성능을 향상

  • short-horizon, long-horizon 모두에서 EgoVLA > EgoVLA-NoPretrain
  • 특히 Stack-Cans, Sort-Cans, Insert-And-Unload-Cans, Flip-Mug에서 큰 차이
    • 인간 데이터는 일반적인 조작 기술 학습에 큰 도움
  • Long-Horizon Task에서 더 큰 차이
  • 새로운 환경에서의 일반화에 큰 영향
  1. Specialist < generalist
  • EgoVLA의 경우 low-level manipulation skill을 공유할 수 있음
  1. 여전히 로봇 데이터는 필요함
  • 인간 영상만으로는 zero-shot 성공률이 0%
  • human과 robot간 차이가 존재함

6. Conclusion & Limitation

EgoVLA

  • 대규모 egocentric human manipulation dataset으로 VLM을 pretraining한 후 소량의 로봇 데이터로 fine-tuning
  • 이때 차이를 극복하기 위해 unfied action space 사용

Limitation

  • hand and wrist pose annotation이 필수적임
  • unified action space를 사용했음에도 추가적인 로봇 데이터로 fine-tuning 해야함
profile
뉴비

0개의 댓글