원제: EgoVLA: Learning Vision-Language-Action Models
from Egocentric Human Videos

1. Introduction
Robotic Manipulation Data
- 관절 매핑 기반 teleoperation tools: 사람이 컨트롤러나 장치를 조종 후 사람의 관절 움직임을 로봇 관절에 직접 매핑
- Exoskeleton: 사람 몸에 기계 장치를 착용
- VR device: 가상 환경에서 로봇을 원격 조작
- 로봇 장비와 숙련된 조작자가 필요하다는 단점이 존재함
인간의 영상을 통한 Manipulation Data
- Hand-Object Interaction: 인간의 시선은 다음 행동의 의도를 드러냄
- 인간의 시선을 이용해 손과 물체의 상호작용을 예측하거나 생성
- 인간의 조작 의도를 장기적으로 예측할 수 있음
- 학습 데이터의 양을 크게 늘릴 수 있음 + 작업과 환경의 다양성 증가
EgoVLA
- 인간의 action space와 로봇의 action space간 차이는 크지 않으며 기하학적 변환을 통해 근사할 수 있음
- 시각 관측 프레임, 언어 지시, 현재 손 자세를 입력으로 주면 몇 단계 미래의 인간 동작을 예측함
- 손목 위치: Inverse Kinematics
- 인간 손 관절: retargeting
- 일부 예측 오류가 존재함
- 이는 소량의 teleoperation data로 fine-tuning하여 보정 가능
Dexterous Manipulation
초기 연구
- Control-Based Method
- 학습이 아닌 물리 법칙과 수학적 모델을 이용해 로봇 제어
- Inverse Kinematics: 목표 위치를 주면 로봇 관절 각도 생성
- Grasp Planning: 물체를 잡기 위한 손가락 위치와 힘 계산
- 정밀한 조작은 가능하지만, 일반화 능력이 제한적
- Learning-Driven Approaches
- Pose Vector: 로봇 손의 자세를 직접 벡터 형태로 생성
- Intermediate Represnetations: 중간 단계의 표현만 먼저 예측
- Contact Maps: 손과 물체 사이의 접촉 위치를 먼저 예측
Egocentric Human Video
- 특정 작업에 대한 정책 학습
- 일반적 작업이 아닌 작업이 한정되어있다는 한계
VLA(Vision-Langauge-Action)
VLMs를 대규모 로봇 데이터로 fine-tuning
- perception과 action 통합
- 데이터 요구량이 매우 큼
- 대규모 teleoperation data
- 스크립트 기반 실행 데이터
Egocentric Vision
기존의 한계
- 데이터 규모와 다양성의 부족
- 복잡한 데이터 셋: 현재 로봇이 수행하기 어려운 활동들
- 단순한 데이터 셋: hand pose와 같은 정밀한 annotation이 부족
Learning from In-the-Wild Video
자연 환경의 영상
- Affordance, 상호작용 단서 추출
- 인간 영상을 이용해 표현을 pre-train하고 transfer이 가능
- 대부분 비지도 학습에만 초점을 둠
3. Learning Manipulation Skills from Ego-Centric Human Videos
Datasets
Language model과 VLMs에서 알 수 있듯, 데이터셋 구조가 모델의 성능에 큰 기여를 한다.
데이터셋 조건: 조작 행동을 포함하는 egocentric video + pose annotations
- Egocentric RGB observations
- wrist pose
- hand pose
- camera pose
실제 데이터셋
- HOI4D: 한 손 조작 작업
- pick-and-place
- re-orientation
- articulated object interaction: 문, 서랍 등을 회전하거나 미는 동작
- HOI3D: 33개의 rigid objects와 상호작용
- HoloAssist: 양손 상호작용
- 배터리 교체, 가구 조립, 기계 설정 등
- 노이즈는 많지만 양손 상호작용을 풍부하게 포함
- 다른 데이터셋에 비해 데이터가 많기에(166시간) 10% 균등 샘플링
- TACO: tool-action-object
Data Processing: Egocentric video는 카메라가 움직이기에 학습이 어려움
- World frame에서 미래 손목 위치를 계산하고, 이를 현재 카메라 기준으로 변환하여 사용
EgoVLA Model
base
- backbone: NVILA-2B
- Vision-Language 이해 능력이 높아서 intention inference에 좋음
- 비교적 작은 모델 크기로 fine-tuning에 좋음
- 입력
- 현재 및 과거의 egocentric 시각 관측: head camera시점 6 frame
- Visual Observation: 0.2초 간격 sampling(총 1초의 과거)
- Language Instruction: High-level이 아닌 즉각적인 행동 지시
- Action Query Tokens: 행동을 예측하도록 요청하는 special tokens
- Human Proprioception: 손목의 이동, 회전, 손 자세
- 해당 입력들을 backbon에서 인코딩하여 action head로 처리
Action Representation
정보
- 손목 자세
- 3D translation
- rot6D rotation
- hand joint angles
- MANO hand model: 상위 15개 PCA 성분
학습(regression)
- 미래 손목 자세, 손 관절 파라미터
- L=λwrist_transLwrist_trans+λwrist_rotLwrist_rot+λjointLjoint
Action Head & Action Query Tokens
구성
- 6개의 encoder layer
- hidden size 1536
input
- 인간/로봇의 proprioception state
- action query token의 latent embedding
output
- 미래 행동 시퀀스
- At=[at,at+1,...,at+H]
Prediction Range
- 1초 미래(30 future steps at 30 Hz)
Action Query Token
- vocabulary의 마지막 30개의 word ID
Training Details
- 인간 데이터 pre-training
- Ego-Centric Human Manipulation Datasets, 20epochs
- 로봇 데이터 post-training
- 115 epochs, 100 epoch 이후 learning rate 감소
Transferring EgoVLA to Humanoid Robot
사람과 휴머노이드 모두 두 팔과 손을 이용한다는 점은 동일하지만, 카메라의 위치, 손의 형태, 시각적 외형의 차이로 인해 바로 적용은 힘듦
- 소량의 로봇 데이터를 이용해 fine-tuning
- 이땐 Unified Action Space를 활용
Retargeting robot data to human representation
로봇의 action space를 인간의 action representation으로 변경하여 정렬
- end-effector pose: 3D 변환으로 로봇과 인간의 좌표계 정렬
- hand configuration: MANO hand model parameter
- minΘL(Θ)=51i=1∑5SmoothL1(Jpred(Θ)i,jobs,i)
- Θ∈R15: MANO 손 파라미터
- Jpred(Θ) MANO forward kinematics로 게산된 손가락 끝
- Jobs∈R5×3 로봇 손가락 끝 실제 위치
Mapping human hand to robot hand
Inference: EgoVLA가 예측한 손목, 손 자세를 robot actuerator instructure
- 예측한 손목 자세 -> 3D 변환으로 End-effector로 변환 -> Inverse Kinematics로 로봇 팔 관절 계산
손 동작 변환
- 예측된 MANO 파라미터로 3D 손 keypoint 계산
- MLP 모델이 손 keypoint로 로봇 손 관절 명령 예측
- 원래 시연 데이터로도 정상적으로 수행되며, 작은 오차가 큰 영향을 주진 않음
4. Ego Humanoid Manipulation Benchmark
필요성
실제 로봇 실험의 문제
- 비용이 매우 비쌈
- 실험 시간이 오래 걸림
- 실험 환경을 동일하게 재현하기 어려움
- 안전 문제
이에 시뮬레이션 기반 평가를 많이 사용함
해당 벤치마크는 sim2real transfer보단 통제되고 재현 가능한 테스트 환경으로 시뮬레이션 활용

Short Horizon Tasks(단일 동작 중심)
- Push-Box, Filp-Mug, Pour-Balls, Close-Drawer, Open-Drawer, Open-Laptop, Stack-Can
Long Horizon Tasks(여러 단계 행동 결합)
- Sort-Cans, Insert-Cans, Unload-Cans, Insert-And-Unload-Cans, Stack-Can-Into-Drawer
Observation & Action Space
벤치마크 관측 정보
- robot joint position
- end-effector poses
- contact force
- egocentric RGB-D visual input
EgoVLA
- Egocentric 시각 정보
- End-effector pose
- hand joint actuation
- task descriptions
로봇 제어
- 팔: end-effector control
- 손: PD joint control
- 6개의 active, 6개의 mimic joints -> 12개의 DoFs
PD control: 목표 관절 위치에 도달하도록 오차를 이용해 힘 계산
τ=Kp(qtarget−q)+Kd(q˙target−q˙)
q는 위치, q˙는 관절 속도
최종적으로 36차원 action space
- arm inverse kinematics
- direct hand actuation
- Control frequency = 30Hz
- 각 작업마다 매 단계 성공 여부, sub-task 완료 여부 확인
Diverse Visual Background
5개의 방, 5개의 테이블 텍스쳐 = 25개의 시각적 환경
Demonstrations
Imitation Learning을 지원하기 위해 전문가 데이터 제공
- teleoperation system으로 수집
- Room 1, 2, 3, Table 1
- 총 100개의 성공 시연
5. Experiments
Human Manipulation Modeling
인간 손 움직임을 얼마나 잘 모델링하는가
- 인간 손목과 미래 위치 예측 오차는 약 8cm
- 언어 지시의 변경에 따라 경로도 정상적으로 변경됨
- 행동 뒤에 있는 semantic intent도 정상적으로 학습함
Evaluation
평가 지표
- Success Rate(SR): 작업을 완전히 성공한 비율
- Progress Rate(PSR): 전체 단계 중 얼마나 많은 단계까지 수행했는지
Baseline
- EgoVLA: 인간 영상 사전 학습 + 로봇 데이터 fine-tuning
- EgoVLA-NoPretrain: 로봇 데이터만 학습
- ACT: 각 작업마다 따로 학습되는 전문 모델
Evaluation Setup
- Seen environment: 학습에서 본 환경
- Unseen environment: 완전히 새로운 환경(일반화 평가)
Result

1. 인간 데이터 pretraining이 성능을 향상
- short-horizon, long-horizon 모두에서 EgoVLA > EgoVLA-NoPretrain
- 특히 Stack-Cans, Sort-Cans, Insert-And-Unload-Cans, Flip-Mug에서 큰 차이
- 인간 데이터는 일반적인 조작 기술 학습에 큰 도움
- Long-Horizon Task에서 더 큰 차이
- 새로운 환경에서의 일반화에 큰 영향
- Specialist < generalist
- EgoVLA의 경우 low-level manipulation skill을 공유할 수 있음
- 여전히 로봇 데이터는 필요함
- 인간 영상만으로는 zero-shot 성공률이 0%
- human과 robot간 차이가 존재함
6. Conclusion & Limitation
EgoVLA
- 대규모 egocentric human manipulation dataset으로 VLM을 pretraining한 후 소량의 로봇 데이터로 fine-tuning
- 이때 차이를 극복하기 위해 unfied action space 사용
Limitation
- hand and wrist pose annotation이 필수적임
- unified action space를 사용했음에도 추가적인 로봇 데이터로 fine-tuning 해야함