[논문 리뷰] Human to Robot Transfer

마계닭·2026년 3월 3일

논문 리뷰

목록 보기
13/18

원제: Emergence of Human to Robot Transfer in Vision-Language-Action Models

1. Introduction

인간의 지식은 로봇에 물리적인 지능을 부여하는 토대

  • VLM을 통해 인간이 생성한 텍스트-이미지로 robot policies 초기화
  • 로봇 원격 조작을 통해 인간이 생성한 행동 모방
  • 누군가 과제를 수행하는 영상을 시청함으로써 인간의 경험으로부터 직접 학습

최신 LM: 데이터 소스를 활용하는 능력은 모델 규모와 밀접하게 관련됨

  • 명시적인 alignment(매핑과정)없이 인간 비디오 데이터로부터 기술을 학습하는 능력은 규모와 관련이 있는가
  • 이를 증명하기 위해 co-training 활용

    co-training: 인간 비디오 데이터 또한 로봇 데이터와 동일한 하나의 embodiment로 취급. 이때 인간 데이터도 로봇 데이터와 동일한 목적함수로 학습

  1. 3D 손 추적 정보로 low level end effector trajectories를 예측
  2. dense language annotation을 활용해서 high level의 하위 과제를 예측
  3. 인간 데이터와 로봇 데이터를 혼합 및 co-finetuning
  4. 인간 데이터에만 존재하는 설정에서 평가

결과: 로봇 데이터의 다양성이 확장될수록 Pre-training된 VLA는 인간 비디오를 더 효과적으로 활용할 수 있게 됨
사전학습의 다양성이 증가할수록 인간 데이터와 로봇 데이터 사이의 latent representation이 alignment됨. 즉, 데이터 범위가 확보되면 시각적, 운동학적 영역 차이가 크더라도 모델이 embodimnet에 구애받지 않는 표현 생성

2. Related Works

Learning from Humans

초기: 비디오 데이터를 활용해 Vision Encoder 학습

  • 시각 표현은 학습할 수 있지만 행동 예측을 직접적으로 향상시키진 못함

Developed proxy

  • Keypoint Tracking: 사람의 손, 물체의 keypoints를 추적
  • Latent Actions: 명시적 행동 값 없이 latent space에 압축해서 표현
  • Reward Modeling: goal state를 학습(success signal)
  • Affordance Prediction: 물체가 무엇을 할 수 있는지를 예측

Explicit Alignment

  • Overlayed robots: 인간이 수행하는 장면 위에 로봇의 외형/관절 모델을 겹쳐서 표시
  • AR/VR: 인간이 AR/VR장비를 착용하고 작업하면서 시스템이 인간의 동작을 직접 측정/유도

한계점

  • 규모가 작아지면 불안정함
  • Alignment에 의존함

Heterogeneous Vision-Language-Action Models

로봇의 원격 조작 데이터 + 웹 규모의 Vision-Language 데이터, 언어 주석

  • Vision-Language Backbone: 인간이 생성한 이미지 + 텍스트에서 폭넓은 의미 이해
  • 대규모 원격 조작 데이터에 대한 행동 모방 학습

Cross-Embodiment Training

  • 하나의 정책을 통합된 아키텍처와 행동 표현으로 여러 로봇 Embodiement를 제어하도록 학습.
  • 공유된 관측 및 행동 공간 외 특별한 alignment없이 embodiement 간 Transfer이 가능함

Scaling Alternative Data Collection Strategies

로봇 원격조작 대용

  • 손으로 조작하는 휴대용 하드웨어 사용
  • UMI: 평행 집게. 자체 움직임 추적

3. Preliminaries

VLA 모델을 사용하여 범용 정책 학습

  • Vision-Language 모델의 아키텍처와 pretraining weight를 계승
  • 연속적인 로봇 제어 출력을 생성하도록 학습
  • Demonstration dataset: D=(ot,lt,at:t+H)D = (o_t, l_t, a_{t:t+H})에 대해 behavior cloning
  • 관측, 언어 명령을 미래 행동 궤적으로 매핑: πθ(at:t+Hot,lt)\pi_\theta(a_{t:t+H} | o_t, l_t)
    행동
  • 이산적 행동 토큰: next-token prediction. FAST 행동 토큰 예측
  • 연속적 행동 토큰: flow-matching objective function. 연속 행동을 복원하는 action expert

π0.5\pi0.5: Objective function(subtask 예측, 객체 탐지, VQA) + co-training하여 일반화 성능이 향상됨

  • subtask: 시각 관측과 상위 언어 명령이 주어졌을 때, subtaskd 문자열을 예측 p(ltsubtaskat,lt)p(l_t^{subtask} | a_t, l_t)
  • 이후 모델에 다시 입력되어 행동 생성 조건으로 사용 πθ(at:t+Hat,lt)\pi_\theta(a_{t:t+H} | a_t, l_t)

4. Fine-tuning with Emergent Human-Robot Alignment

최종 목적

  • Explicit alignment없이 활용
  • 인간 설계 휴리스틱보다 대형 모델이 다양한 데이터 소스로부터 관련 정보를 흡수할 수 있는 능력에 의존

Human Data Collection Pipeline

Data Collection Device

  • 고해상도 head-worn camera
  • 2개의 손목 장착 카메라: end-effector와 조작 대상 간의 상호작용을 자세히 관찰할 수 있음

Data Collection Protocol

  • 인간 데이터를 에피소드 형태로 수집
  • 인간과 로봇 사이의 차이를 시각적, 운동학적 차이로만 제한할 수 있음
  • 수집자들은 각 과제에 대해 반복적인 시연
  • 카메라 시야 안에서 유지되도록 요청

Data processing & Annotation

  • 시점 t에서 head-worn camera의 6D 움직임 etR6e_t \in \mathbb R^6(세계 좌표계 기준)

    6D: Translation 3개(x, y, z) + Rotation 3개(Roll, Pitch, Yaw)

  • 두 손 카메라 17개 3D Keypoints hteR3×17h_t^e \in \mathbb R^{3 \times 17}
    (head-worn camera 기준: 카메리를 원점으로 하는 좌표계)
  • 팔의 동작을 설명하는 텍스트 기반 subtask 주석

Action Space

  • 인간-로봇 행동 표현을 유사하게 정렬
    - Joint-position, End-effector pose trajectory
    이 중 Joint-position은 정확한 추정이 어렵기에 End-effector based trajectory
  • Action Chunk(길이 H): [a0,a1,...,aH][a_0, a_1, ..., a_H]
    이때 각 aia_i는 현재 상태의 6DoF pose
  • 전체 Action Space
    - 왼팔: 6DoF + Gripper(1차원)
    - 오른팔: 6DoF + Gripper
    - 베이스 이동: 2 dimension(x, y 이동)
    - 총합: aRH×16a \in \mathbb R^{H \times 16}

Training Objectives

  • low level action prediction
    - Discrete Fast tokens에 대한 next-token 예측
    - Continuous action에 대한 flow matching loss
    - πθ(atot,ltsubtask)\pi_\theta(a_t | o_t, l_t^{subtask})
  • high level subtask prediction
    - subtask language tokens에서 next-token을 예측
    - πθ(ltsubtaskot,lt)\pi_\theta(l_t^{subtask} | o_t, l_t)

Training Mixture

  • fine-tuning시에 기존 능력을 유지 + 인간 데이터의 새로운 개념을 도입
  • simple recipe 사용
    - human data for generalization task: 50%
    - 가장 유사한 robot task: 50%
  • 위의 혼합으로 π0.5\pi_{0.5}를 fine-tuning하여 egocentric data를 통합한 모델을 π0.5+ego\pi_{0.5} + ego라고 지칭

Experimental Findings

Benchmark

목적: 로봇 데이터에는 없고 인간 데이터에만 존재하는 개념을 로봇이 수행할 수 있는가

Scene Transfer(Spice, Dresser)

  • 로봇 데이터: 특정 몇 개의 집에서만 task
    인간 데이터: 완전히 새로운 집에서 동일한 task
  • 평가: 새로운 집에서 작업 성공 여부

Object Transfer(Bussing)

  • 로봇 데이터: 특정 종류의 물체 정리
    인간 데이터: 새로운 물체 유형 포함
  • 평가: 올바르게 정리한 물체 개수

Task Generalization(Eggs)

  • 로봇 데이터: 달걀을 상자에 넣기만 학습
    인간 데이터: 색깔별 달걀 분류라는 새로운 개념 포함
  • 평가: 올바르게 분류한 달걀 개수

Result


위의 3가지 벤치마크에 대해서 모두 성능이 향상된 모습을 보임

해석

  • 기존의 robot-only(π0.5)\pi_{0.5})는 기본적인 조작 능력만 존재하고 새로운 의미 구조를 파악하지 못함
  • 인간 데이터와 co-finetuning하면(π0.5+ego\pi_{0.5}+ego)하면 인간 데이터의 개념을 실행 가능
  • 인간 데이터는 단순 보조 데이터가 아닌 새로운 능력을 실제 행동으로 전이

주장

충분히 다양한 pretraining이 존재할 때 인간 데이터를 제대로 활용할 수 있다.

실험 설계

  • 0%: 기본 VLM
  • 25%, 50%, 75%, 100%: 점점 더 다양한 로봇데이터
  • 100% + X-Emb: 여러 로봇 Embodiment 포함

    X-Emb(Cross-Embodiment): 서로 다른 몸 구조 간 학습(인간 - 로봇, 서로 다른 로봇)

결과

  • pre-training이 적은 경우(0%, 25%): 인간 데이터를 추가해도 성능 향상 없음
  • 중간 수준(50%): 일부 task에서만 효과가 나타남
  • 충분히 다양한 경우(75%): 인간 데이터 효과가 급격하게 증가함
  • 최대 다양성(100% + X-emb): Transfer 효과가 가장 강함

작업별

  • Sort Eggs: 인간 데이터가 있을 때만 급격히 성능 상승.
    \rightarrow 새로운 의미 구조는 인간 데이터에만 의존함
  • Dresser: 50% 이하에선 인간 데이터가 오히려 방해가 됨

해석

t-SNE 분석

  • 사전학습이 적으면 인간과 로봇의 표현이 분리됨
  • 다양성이 증가하면서 두 표현이 겹치기 시작함

즉, 인간에서 로봇으로 transfer은 단순 데이터 추가 효과가 아닌 규모 의존적인 창발 현상임

인간 데이터의 가치

Upper Bound: Target Robot(ARX)과 비교

  • Sort Eggs, Dresser: 인간 데이터 성능 \approx target robot 데이터 성능
  • Bussing: 인간 데이터 성능 << target robot 데이터 성능

다른 로봇 embodiment data(UR5)

  • Bussing: 인간 to ARX transfer \approx UR5 to ARX
  • 인간 데이터는 다른 embodiment data처럼 작동함

결론

일반적으론 다른 로봇 embodiment와 유사한 수준의 Transfer을 보이고, 일부 작업에선 Target Robot Data에 근접한 성능을 보여줌

High-Level과 Low-Level에서 Transfer

High-Level(HL)과 Low-Level(LL)

HL: subtask prediction
LL: 실제 행동의 trajectory 예측(6DoF 등)

실험

  1. Robot-only HL + Robot-only LL
  2. Human data HL + Robot-only LL
  3. Robot-only HL + Human data LL
  4. Human data HL+LL

Result

  • HL만 인간 데이터 사용: LL이 명령을 제대로 따르지 못함(잘못된 위치에 배치)
  • LL만 인간 데이터 사용: HL이 잘못된 subtask 예측(엉뚱한 행동 지시)
  • 모두 인간 데이터를 사용한 4번에서 가장 높은 성능
  • 즉, 인간 데이터 Transfer은 HL과 LL 모두에서 나타난다.

손목 카메라의 효용성

  • Dresser, Bussing에 대해서는 성능이 향상되었고, Spice, Eggs에선 큰 차이가 발생하지 않았다.
  • 즉, 정밀한 물체 조작이 중요한 작업에서는 도움이 되지만, 비교적 global한 정보가 중요한 경우에는 큰 차이가 발생하지 않는다.

6. Discussion

  • 제한된 pretraining에선 인간 데이터의 Transfer이 실패함
  • Pretraining이 임계점을 넘어서면 Transfer이 창발적으로 나타남
  • 해당 연구는 VLA 모델 확장에 있어서 유망한 방향을 제시함
profile
뉴비

0개의 댓글