RT-1 : Robotics Transformer for Real-World Control at Scale

윤준영·2026년 7월 10일

Robotics

목록 보기
1/1

1. Abstract & Introduction

방대하고 다양하면서 task가 명확하게 정의되지 않은 데이터셋을 통해 지식을 전이함으로서 현대 머신러닝 모델들은 zero shot이나 작은 task 맞춤형 데이터만으로도 하위 작업들을 잘 해결할 수 있다. 이 능력은 CV, NLP 등에서는 충분히 입증되었지만, 로봇 분야에서는 아직 충분히 보여지지 않았다. 로봇 분야에서도 이와 같은 성공을 거두려면 task-agnostic한 학습과 방대하고 다양한 로봇 데이터를 모두 흡수할 수 있는 고용량 아키텍쳐의 결합이 필요하다. 성공적인 모델 구축을 위해서는 두 가지 주요 과제를 해결해야 한다.
1. 적절한 데이터셋 구축

  • 로봇 공학에서는 데이터셋이 특정 로봇에 국한되고 수작업으로 수집되는 경우가 많다. 우수한 일반화 성능을 얻으려면 다양한 작업과 환경을 아우르는 데이터셋이 필요하다.
  • 17개월동안 13 대의 로봇 플릿을 이용해 수집한 약 13만 개의 에피소드와 700개 이상의 task가 포함된 데이터셋 구축 및 활용
  1. 모델 설계
  • 효율적인 다중 로봇 작업에는 고용량 모델이 필수적이며, Transformer 모델이 탁월한 성능을 발휘 중이다.
  • 하지만 로봇은 실시간으로 해결될만큼 효율적이어야 하는데, Transformer는 이런 부분에서 해결할 과제들이 있다.
  • RT-1은 이미지, 지시어, 모터 명령을 포함한 고차원 입출력을 Transformer가 사용할 수 있는 간결한 토큰으로 인코딩하여 실시간 제어할 수 있는 아키텍쳐를 제안한다.

2. Preliminaries

Robot learning

타임 스텝 t=0t=0에서 정책 π\pi에는 언어 지시어 ii와 초기 이미지 관측값 xox_o가 주어지고, 정책은 행동 분포 π(i,xo)\pi (\cdot|i,x_o) 생성 및 행동 aoa_o를 sampling하여 로봇에 적용한다. 이 과정이 종료 조건이 충족될 때까지 진행되고, 종료 단계까지의 전체 상호작용을 하나의 에피소드라고 한다. 이 에피소드에 대해 로봇이 지시어 ii의 수행 여부를 나타내는 이진 보상 rr이 주어지고, 여기서의 목표는 지시어 ii, 초기 상태 x0x_0, 그리고 전이 역학의 분포에 대한 기댓값으로 평균 보상을 최대화하는 정책 π\pi를 학습하는 것이다.

3. System Overview

연구의 목표는 방대한 양의 데이터를 흡수하고 효과적으로 일반화할 수 있는 범용 로봇 학습 시스템을 구축하는 것이다.

논문에서 사용한 로봇은 7DoF의 팔과 두 손가락 gripper로 구성된 Everyday Robot을 사용한다. 데이터 수집 및 평가를 위해 3가지의 주방 기반 환경을 사용한다 (a~c). 훈련 데이터는 지시어에 대한 로봇의 행동을 직접 주석으로 달아준다. 지시어는 하나의 동사 (pick, open, ...)와 하나 이상의 명사 (apple, drawer, ...)로 구성된다.

네트워크는 짧은 이미지 시퀀으솨 지시어를 입력으로 받아 각 타임 스텝마다 로봇의 행동을 출력한다. 이미지와 텍스트는 FiLM을 통해 임베딩된 지시어에 조건화된 EfficientNet을 통해 처리된다. 이미지 토큰 집합을 계산하기 위해 TokenLearner가 적용되며, 마지막으로 Transformer를 통해 이산화된 action 토큰을 생성한다. Action은 팔 움직임을 위한 7개 차원 (xx, yy, zz, roll, pitch, yaw, gripper 열림), 베이스 움직임을 위한 3개 차원 (xx, yy, yaw), '팔 제어'와 '베이스 제어' 혹은 '에피소드 종료' 세가지 모드를 제어하는 이산 차원으로 구성된다.

4. RT-1

4.1. Model

모델의 전반적인 구조는 아래와 같다.

Instruction and image tokenization

RT-1은 ImageNet으로 사전 학습된 EfficientNet-B3 모델을 통해 6 개의 이미지 시퀀스를 토큰화한다. 이 이미지들은 300×300300\times 300 해상도로 입력되고 9×9×5129 \times 9 \times 512 형태의 공간 feature map을 출력한다. 대부분의 기존 연구들은 이미지를 Transformer에 주입하기 전에 패치 형태로 분할하지만, 본 연구는 출력된 feature map을 81 개의 vision 토큰으로 만들어 네트워크의 다음 레이어로 전달한다. 지시어는 사전 학습된 언어 임베딩 형태로 이미지 tokenizer의 컨디션으로 제공한다. 이 작업을 통해 task와 관련된 이미지 특성을 초기에 추출할 수 있다. 지시어 임베딩은 Universal Sentence Encoder를 사용하고, 이 임베딩은 FiLM 레이어의 입력으로 사용되어 이미지 인코더에 컨디션을 주게 된다. 즉, 출력된 81 개의 vision 토큰은 vision language token이 된다.

TokenLearner

TokenLearner는 추론 속도를 올리기 위해, 그리고 RT-1이 필요한 토큰 수로 압축하기 위해 사용한다. TokenLearner는 element-wise attention 모듈로, 많은 양의 코튼들 중 중요한 토큰 조합을 만들어 Transformer 층으로 보내게 된다. 최종적으로 81 개의 토큰 중 8 개의 토큰으로 압축된다.

Transformer

각 이미지마다 최종 8 개의 토큰이 만들어지고, 총 6 개의 프레임이 들어오므로 합쳐서 최종 48 개의 토큰이 Transformer 레이어로 들어간다. Transformer 레이어는 8 개의 self-attention 레이어로 구성되고, 연산 이후 256 차원으로 이루어진 11 개의 토큰이 출력된다.

Action tokenization

Action은 총 11 개의 변수 (팔 움직임 7차원, 베이스 움직임 3차원, 모드 스위치)로 이루어져 있고, 각 변수는 256 개의 구간 중 하나에 매필된다. 이 구간은 각 변수의 범위 내에서 균등하게 분포한다.

Inference speed

로봇은 사람이 지시어를 실행하는 것보다 느려서는 안 된다. 이를 위한 모델의 필수 요건은 빠르고 일관된 추론 속도이다. RT-1은 추론 속도를 높이기 위해

  1. TokenLearner를 사용해서 처리할 토큰의 수를 줄였고 (속도 2.5배 향상)
  2. 토큰들을 한 번만 연산한 후 이후의 추론에서 겹치는 window에서 재사용한다 (속도 1.7배 향상)
profile
AMC AI research engineer

0개의 댓글