방대하고 다양하면서 task가 명확하게 정의되지 않은 데이터셋을 통해 지식을 전이함으로서 현대 머신러닝 모델들은 zero shot이나 작은 task 맞춤형 데이터만으로도 하위 작업들을 잘 해결할 수 있다. 이 능력은 CV, NLP 등에서는 충분히 입증되었지만, 로봇 분야에서는 아직 충분히 보여지지 않았다. 로봇 분야에서도 이와 같은 성공을 거두려면 task-agnostic한 학습과 방대하고 다양한 로봇 데이터를 모두 흡수할 수 있는 고용량 아키텍쳐의 결합이 필요하다. 성공적인 모델 구축을 위해서는 두 가지 주요 과제를 해결해야 한다.
1. 적절한 데이터셋 구축
타임 스텝 에서 정책 에는 언어 지시어 와 초기 이미지 관측값 가 주어지고, 정책은 행동 분포 생성 및 행동 를 sampling하여 로봇에 적용한다. 이 과정이 종료 조건이 충족될 때까지 진행되고, 종료 단계까지의 전체 상호작용을 하나의 에피소드라고 한다. 이 에피소드에 대해 로봇이 지시어 의 수행 여부를 나타내는 이진 보상 이 주어지고, 여기서의 목표는 지시어 , 초기 상태 , 그리고 전이 역학의 분포에 대한 기댓값으로 평균 보상을 최대화하는 정책 를 학습하는 것이다.
연구의 목표는 방대한 양의 데이터를 흡수하고 효과적으로 일반화할 수 있는 범용 로봇 학습 시스템을 구축하는 것이다.

논문에서 사용한 로봇은 7DoF의 팔과 두 손가락 gripper로 구성된 Everyday Robot을 사용한다. 데이터 수집 및 평가를 위해 3가지의 주방 기반 환경을 사용한다 (a~c). 훈련 데이터는 지시어에 대한 로봇의 행동을 직접 주석으로 달아준다. 지시어는 하나의 동사 (pick, open, ...)와 하나 이상의 명사 (apple, drawer, ...)로 구성된다.

네트워크는 짧은 이미지 시퀀으솨 지시어를 입력으로 받아 각 타임 스텝마다 로봇의 행동을 출력한다. 이미지와 텍스트는 FiLM을 통해 임베딩된 지시어에 조건화된 EfficientNet을 통해 처리된다. 이미지 토큰 집합을 계산하기 위해 TokenLearner가 적용되며, 마지막으로 Transformer를 통해 이산화된 action 토큰을 생성한다. Action은 팔 움직임을 위한 7개 차원 (, , , roll, pitch, yaw, gripper 열림), 베이스 움직임을 위한 3개 차원 (, , yaw), '팔 제어'와 '베이스 제어' 혹은 '에피소드 종료' 세가지 모드를 제어하는 이산 차원으로 구성된다.
모델의 전반적인 구조는 아래와 같다.

RT-1은 ImageNet으로 사전 학습된 EfficientNet-B3 모델을 통해 6 개의 이미지 시퀀스를 토큰화한다. 이 이미지들은 해상도로 입력되고 형태의 공간 feature map을 출력한다. 대부분의 기존 연구들은 이미지를 Transformer에 주입하기 전에 패치 형태로 분할하지만, 본 연구는 출력된 feature map을 81 개의 vision 토큰으로 만들어 네트워크의 다음 레이어로 전달한다. 지시어는 사전 학습된 언어 임베딩 형태로 이미지 tokenizer의 컨디션으로 제공한다. 이 작업을 통해 task와 관련된 이미지 특성을 초기에 추출할 수 있다. 지시어 임베딩은 Universal Sentence Encoder를 사용하고, 이 임베딩은 FiLM 레이어의 입력으로 사용되어 이미지 인코더에 컨디션을 주게 된다. 즉, 출력된 81 개의 vision 토큰은 vision language token이 된다.

TokenLearner는 추론 속도를 올리기 위해, 그리고 RT-1이 필요한 토큰 수로 압축하기 위해 사용한다. TokenLearner는 element-wise attention 모듈로, 많은 양의 코튼들 중 중요한 토큰 조합을 만들어 Transformer 층으로 보내게 된다. 최종적으로 81 개의 토큰 중 8 개의 토큰으로 압축된다.

각 이미지마다 최종 8 개의 토큰이 만들어지고, 총 6 개의 프레임이 들어오므로 합쳐서 최종 48 개의 토큰이 Transformer 레이어로 들어간다. Transformer 레이어는 8 개의 self-attention 레이어로 구성되고, 연산 이후 256 차원으로 이루어진 11 개의 토큰이 출력된다.
Action은 총 11 개의 변수 (팔 움직임 7차원, 베이스 움직임 3차원, 모드 스위치)로 이루어져 있고, 각 변수는 256 개의 구간 중 하나에 매필된다. 이 구간은 각 변수의 범위 내에서 균등하게 분포한다.

로봇은 사람이 지시어를 실행하는 것보다 느려서는 안 된다. 이를 위한 모델의 필수 요건은 빠르고 일관된 추론 속도이다. RT-1은 추론 속도를 높이기 위해