원제: Emergence of Human to Robot Transfer in Vision-Language-Action Models
1. Introduction
인간의 지식은 로봇에 물리적인 지능을 부여하는 토대
- VLM을 통해 인간이 생성한 텍스트-이미지로 robot policies 초기화
- 로봇 원격 조작을 통해 인간이 생성한 행동 모방
- 누군가 과제를 수행하는 영상을 시청함으로써 인간의 경험으로부터 직접 학습
최신 LM: 데이터 소스를 활용하는 능력은 모델 규모와 밀접하게 관련됨
- 명시적인 alignment(매핑과정)없이 인간 비디오 데이터로부터 기술을 학습하는 능력은 규모와 관련이 있는가
- 이를 증명하기 위해 co-training 활용
co-training: 인간 비디오 데이터 또한 로봇 데이터와 동일한 하나의 embodiment로 취급. 이때 인간 데이터도 로봇 데이터와 동일한 목적함수로 학습
- 3D 손 추적 정보로 low level end effector trajectories를 예측
- dense language annotation을 활용해서 high level의 하위 과제를 예측
- 인간 데이터와 로봇 데이터를 혼합 및 co-finetuning
- 인간 데이터에만 존재하는 설정에서 평가

결과: 로봇 데이터의 다양성이 확장될수록 Pre-training된 VLA는 인간 비디오를 더 효과적으로 활용할 수 있게 됨
사전학습의 다양성이 증가할수록 인간 데이터와 로봇 데이터 사이의 latent representation이 alignment됨. 즉, 데이터 범위가 확보되면 시각적, 운동학적 영역 차이가 크더라도 모델이 embodimnet에 구애받지 않는 표현 생성
Learning from Humans
초기: 비디오 데이터를 활용해 Vision Encoder 학습
- 시각 표현은 학습할 수 있지만 행동 예측을 직접적으로 향상시키진 못함
Developed proxy
- Keypoint Tracking: 사람의 손, 물체의 keypoints를 추적
- Latent Actions: 명시적 행동 값 없이 latent space에 압축해서 표현
- Reward Modeling: goal state를 학습(success signal)
- Affordance Prediction: 물체가 무엇을 할 수 있는지를 예측
Explicit Alignment
- Overlayed robots: 인간이 수행하는 장면 위에 로봇의 외형/관절 모델을 겹쳐서 표시
- AR/VR: 인간이 AR/VR장비를 착용하고 작업하면서 시스템이 인간의 동작을 직접 측정/유도
한계점
- 규모가 작아지면 불안정함
- Alignment에 의존함
Heterogeneous Vision-Language-Action Models
로봇의 원격 조작 데이터 + 웹 규모의 Vision-Language 데이터, 언어 주석
- Vision-Language Backbone: 인간이 생성한 이미지 + 텍스트에서 폭넓은 의미 이해
- 대규모 원격 조작 데이터에 대한 행동 모방 학습
Cross-Embodiment Training
- 하나의 정책을 통합된 아키텍처와 행동 표현으로 여러 로봇 Embodiement를 제어하도록 학습.
- 공유된 관측 및 행동 공간 외 특별한 alignment없이 embodiement 간 Transfer이 가능함
Scaling Alternative Data Collection Strategies
로봇 원격조작 대용
- 손으로 조작하는 휴대용 하드웨어 사용
- UMI: 평행 집게. 자체 움직임 추적
3. Preliminaries
VLA 모델을 사용하여 범용 정책 학습
- Vision-Language 모델의 아키텍처와 pretraining weight를 계승
- 연속적인 로봇 제어 출력을 생성하도록 학습
- Demonstration dataset: D=(ot,lt,at:t+H)에 대해 behavior cloning
- 관측, 언어 명령을 미래 행동 궤적으로 매핑: πθ(at:t+H∣ot,lt)
행동
- 이산적 행동 토큰: next-token prediction. FAST 행동 토큰 예측
- 연속적 행동 토큰: flow-matching objective function. 연속 행동을 복원하는 action expert
π0.5: Objective function(subtask 예측, 객체 탐지, VQA) + co-training하여 일반화 성능이 향상됨
- subtask: 시각 관측과 상위 언어 명령이 주어졌을 때, subtaskd 문자열을 예측 p(ltsubtask∣at,lt)
- 이후 모델에 다시 입력되어 행동 생성 조건으로 사용 πθ(at:t+H∣at,lt)
4. Fine-tuning with Emergent Human-Robot Alignment
최종 목적
- Explicit alignment없이 활용
- 인간 설계 휴리스틱보다 대형 모델이 다양한 데이터 소스로부터 관련 정보를 흡수할 수 있는 능력에 의존
Human Data Collection Pipeline

Data Collection Device
- 고해상도 head-worn camera
- 2개의 손목 장착 카메라: end-effector와 조작 대상 간의 상호작용을 자세히 관찰할 수 있음
Data Collection Protocol
- 인간 데이터를 에피소드 형태로 수집
- 인간과 로봇 사이의 차이를 시각적, 운동학적 차이로만 제한할 수 있음
- 수집자들은 각 과제에 대해 반복적인 시연
- 카메라 시야 안에서 유지되도록 요청
Data processing & Annotation
- 시점 t에서 head-worn camera의 6D 움직임 et∈R6(세계 좌표계 기준)
6D: Translation 3개(x, y, z) + Rotation 3개(Roll, Pitch, Yaw)
- 두 손 카메라 17개 3D Keypoints hte∈R3×17
(head-worn camera 기준: 카메리를 원점으로 하는 좌표계)
- 팔의 동작을 설명하는 텍스트 기반 subtask 주석
Action Space
- 인간-로봇 행동 표현을 유사하게 정렬
- Joint-position, End-effector pose trajectory
이 중 Joint-position은 정확한 추정이 어렵기에 End-effector based trajectory
- Action Chunk(길이 H): [a0,a1,...,aH]
이때 각 ai는 현재 상태의 6DoF pose
- 전체 Action Space
- 왼팔: 6DoF + Gripper(1차원)
- 오른팔: 6DoF + Gripper
- 베이스 이동: 2 dimension(x, y 이동)
- 총합: a∈RH×16
Training Objectives
- low level action prediction
- Discrete Fast tokens에 대한 next-token 예측
- Continuous action에 대한 flow matching loss
- πθ(at∣ot,ltsubtask)
- high level subtask prediction
- subtask language tokens에서 next-token을 예측
- πθ(ltsubtask∣ot,lt)
Training Mixture
- fine-tuning시에 기존 능력을 유지 + 인간 데이터의 새로운 개념을 도입
- simple recipe 사용
- human data for generalization task: 50%
- 가장 유사한 robot task: 50%
- 위의 혼합으로 π0.5를 fine-tuning하여 egocentric data를 통합한 모델을 π0.5+ego라고 지칭
Experimental Findings
Benchmark
목적: 로봇 데이터에는 없고 인간 데이터에만 존재하는 개념을 로봇이 수행할 수 있는가
Scene Transfer(Spice, Dresser)
- 로봇 데이터: 특정 몇 개의 집에서만 task
인간 데이터: 완전히 새로운 집에서 동일한 task
- 평가: 새로운 집에서 작업 성공 여부
Object Transfer(Bussing)
- 로봇 데이터: 특정 종류의 물체 정리
인간 데이터: 새로운 물체 유형 포함
- 평가: 올바르게 정리한 물체 개수
Task Generalization(Eggs)
- 로봇 데이터: 달걀을 상자에 넣기만 학습
인간 데이터: 색깔별 달걀 분류라는 새로운 개념 포함
- 평가: 올바르게 분류한 달걀 개수
Result

위의 3가지 벤치마크에 대해서 모두 성능이 향상된 모습을 보임
해석
- 기존의 robot-only(π0.5)는 기본적인 조작 능력만 존재하고 새로운 의미 구조를 파악하지 못함
- 인간 데이터와 co-finetuning하면(π0.5+ego)하면 인간 데이터의 개념을 실행 가능
- 인간 데이터는 단순 보조 데이터가 아닌 새로운 능력을 실제 행동으로 전이
주장
충분히 다양한 pretraining이 존재할 때 인간 데이터를 제대로 활용할 수 있다.
실험 설계
- 0%: 기본 VLM
- 25%, 50%, 75%, 100%: 점점 더 다양한 로봇데이터
- 100% + X-Emb: 여러 로봇 Embodiment 포함
X-Emb(Cross-Embodiment): 서로 다른 몸 구조 간 학습(인간 - 로봇, 서로 다른 로봇)
결과
- pre-training이 적은 경우(0%, 25%): 인간 데이터를 추가해도 성능 향상 없음
- 중간 수준(50%): 일부 task에서만 효과가 나타남
- 충분히 다양한 경우(75%): 인간 데이터 효과가 급격하게 증가함
- 최대 다양성(100% + X-emb): Transfer 효과가 가장 강함
작업별

- Sort Eggs: 인간 데이터가 있을 때만 급격히 성능 상승.
→ 새로운 의미 구조는 인간 데이터에만 의존함
- Dresser: 50% 이하에선 인간 데이터가 오히려 방해가 됨
해석
t-SNE 분석
- 사전학습이 적으면 인간과 로봇의 표현이 분리됨
- 다양성이 증가하면서 두 표현이 겹치기 시작함
즉, 인간에서 로봇으로 transfer은 단순 데이터 추가 효과가 아닌 규모 의존적인 창발 현상임
인간 데이터의 가치
Upper Bound: Target Robot(ARX)과 비교
- Sort Eggs, Dresser: 인간 데이터 성능 ≈ target robot 데이터 성능
- Bussing: 인간 데이터 성능 < target robot 데이터 성능
다른 로봇 embodiment data(UR5)

- Bussing: 인간 to ARX transfer ≈ UR5 to ARX
- 인간 데이터는 다른 embodiment data처럼 작동함
결론
일반적으론 다른 로봇 embodiment와 유사한 수준의 Transfer을 보이고, 일부 작업에선 Target Robot Data에 근접한 성능을 보여줌
High-Level과 Low-Level에서 Transfer
High-Level(HL)과 Low-Level(LL)
HL: subtask prediction
LL: 실제 행동의 trajectory 예측(6DoF 등)
실험
- Robot-only HL + Robot-only LL
- Human data HL + Robot-only LL
- Robot-only HL + Human data LL
- Human data HL+LL
Result
- HL만 인간 데이터 사용: LL이 명령을 제대로 따르지 못함(잘못된 위치에 배치)
- LL만 인간 데이터 사용: HL이 잘못된 subtask 예측(엉뚱한 행동 지시)
- 모두 인간 데이터를 사용한 4번에서 가장 높은 성능
- 즉, 인간 데이터 Transfer은 HL과 LL 모두에서 나타난다.
손목 카메라의 효용성

- Dresser, Bussing에 대해서는 성능이 향상되었고, Spice, Eggs에선 큰 차이가 발생하지 않았다.
- 즉, 정밀한 물체 조작이 중요한 작업에서는 도움이 되지만, 비교적 global한 정보가 중요한 경우에는 큰 차이가 발생하지 않는다.
6. Discussion
- 제한된 pretraining에선 인간 데이터의 Transfer이 실패함
- Pretraining이 임계점을 넘어서면 Transfer이 창발적으로 나타남
- 해당 연구는 VLA 모델 확장에 있어서 유망한 방향을 제시함