Title : Geometric Action Model for Robot Policy Learning (ArXiv 2026)
논문 링크 : https://arxiv.org/pdf/2606.17046
Github: https://cvlab-kaist.github.io/Geometric-Action-Model/

1. Introduction
-
자연어 지시를 따르고 다양한 환경에서 임의의 물체를 능숙하게 조작할 수 있는 범용 조작 정책(Generalist Manipulation Policies) 구축
-
이를 위해 언어, 시각적 외형, 장면 기하학, 로봇 상태 및 물리적 역학(Dynamics)에 대한 통합된 이해가 필수적임.
-
기존 Foundation Model 활용의 한계
- VLA(Vision-Language-Action) Model: 시각-언어 모델을 로봇 액션에 매핑하지만, 2D 사전 지식(Priors)에만 의존하며 3D 이해도가 부족함.
- WAM(Video World-Action Model): 비디오 생성 모델에 Prediction 능력을 활용해 미래 프레임과 액션을 공동 모델링하지만, 역시 2D 픽셀 공간에 머물러 있음.
- 공통 한계: Depth, Scale, Occlusion 등의 3D 단서가 암시적으로만 남게 되어 환경 변화(특히 로봇 초기 상태 및 카메라 시점 변화)에 대한 일반화 능력이 크게 떨어짐.
-
최근 3D Geometry 정보 도입 시도와 한계
- raw PointCloud를 직접 학습하는 방식은 일반화에 유용하나 task별 인코더를 처음부터 학습해야함.
- Geometric Foundation Model(GFM)의 특징을 VLA Backbone에 Distillation하거나, GFM 최종 Feature 위에 가벼운 action head를 붙이는 방식이 제안됨.
- 한계 : GFM을 단순히 Static Feature Extractor로만 사용할 뿐, GFM의 다층 기하학적 구조 자체를 시간적 변화에 예측 및 액션 생성을 위한 자체 substrate로 직접 재활용하지 못함.

- Vision-Language-Action(VLA)
- Pretraining 된 VLM을 Fine-tune하여 로봇 액션 토큰을 autoregressive하게 decoding하거나, Flow matching, Diffusion Head 등을 연결해 액션을 출력함. 휴머노이드 및 다양한 Embodied 제어로 확장 중임.
- Limitation: 2D 이미지 사전 지식에만 의존하여 3D 공간 이해도가 부족함. 최근 GFM 특징과 정렬(Alignment)하려는 시도가 있었으나 GFM 백본의 잠재력을 완전히 활용하지 못함.
- World Action Models for Robot Manipulation
- 기존 방식
- Large Video Generation Model을 Fine-tune하여 미래 프레임과 액션을 공동 예측함.
- 시각 백본은 고정하고 잠재 특징 공간에서 별도의 시간적 예측기를 학습시켜 MPC 등에 활용함.
- Limitation: 두 방식 모두 2D 픽셀/이미지 공간 기반의 비디오 백본을 사용하므로 Depth, Scale, Occlusion 문제를 명시적으로 해결하지 못함.
- GAM의 차별점: 풍부한 3D 사전 지식을 가진 GFM의 Latent Space 내부에서 미래를 예측함.
- Geometric Foundation Models, GFMs)
- 기존 방식: Multi-View Image에서 3D 구조를 추론하는 GFM(ex: VGGT, Depth Anything3)을 로봇 정책의 동결된 feature extractor, 인코더 대체, 혹은 Pointcloud 융합용으로 사용함.최근 액션과 3D 속성을 공동 예측하거나, diffusion 기반으로 미래 3D latent token을 함께 De-nosing하는 동시 연구들이 존재.
- GAM: 별도의 Head나 Diffusion 과정없이 단일 Autoregressive 시퀀스 내에서 액션과 미래 장면 예측을 함께 모델링.
- GFM의 Deep blocks들을 단순히 관측 특징 처리용이 아니라, World Model이 예측한 미래 토큰을 디코딩하는 주체로 직접 재활용
3. Preliminaries: Geometric Foundation Models

4. GAM: Geometric Action Model
-
목표: Language-conditioned robot manipulation)을 수행하는 Policy πθ을 학습하는 것
-
입력 데이터(매 Timestep t마다 수집):
- ot={Iv,t}v=1V: 고정된 V개의 카메라로부터 얻은 Multi-View RGB관측치
- st∈Rds : 로봇의 관절 구성 및 말단 효과기(End-effector) 포즈를 나타내는 Proprioceptive state
- l: 에피소드 내내 일정하게 유지되는 task instruction
-
출력 데이터
- a^t∈RC×da: 길이 C를 가지는 Action Chunk로 다음 관측치를 얻기 전까지 Open-loop로 실행할 C개의 Δ Pose 또는 관절 명령을 인코딩함.
- 정책 함수 정의(Context Window H 반영):
πθ:({ot−H+1,...,ot},{st−H+1,...,st},{at−H,...,at−1},l)↦a^t
-
데이터셋: N개의 expert demonstration D=(τi,li)i=1N 로부터 학습을 진행함.
-
전체 아키텍처 개요(Overview)
- Pretrained GFM을 특정 Layer에서 반으로 쪼개고, 그 사이에 Causal Temporal Predictor를 삽입한 구조
- 미래 예측과 모든 제어 연산이 외부 공간이 아닌, GFM 고유의 3D 기하학적 Latent Space 내부에서 수행되도록 설계함.
4.2 Observation Encoder
- GFM Backbone 분리(Split)
- GFM 트랜스포머 stack을 split Layer Ls를 기준으로 Encoder(E≤Ls), Decoder(D>Ls)로 Split함.
E≤Ls=f(Ls)∘⋅⋅⋅∘f(1),D>Ls=f(M)∘...∘f(Ls+1)
- Split Layer Ls 선정의 제약 조건
- 원본 RGB로부터 충분히 풍부한 visual feature을 추출할 수 있을 만큼 깊어야 함.
- 하지만 GFM의 뎁스 헤드(DPT)가 사용하는 가장 첫 번째 Layer m1보다는 얕아야 함.(Ls<m1). 그래야 예측된 미래 잠재 토큰들이 뎁스 헤드를 통해 3D Geometric image로 디코딩될 수 있기 때문임.
- 인코딩 연산 과정
- Context 윈도우 내의 각 타임스텝 t′에 대해, 멀티뷰 RGB 관측치 ot′를 GFM 패치 임베딩으로 토큰화하여 초기 시퀀스 Zt′(0)를 생성함.
- 이를 앞단 인코더 E≤Ls에 통과시켜 타임스텝별 기하학적 잠재 상태의 시퀀스를 획득함.
{Zt−H+1(Ls),...,Zt(Ls)}
4.3 Causal Future Predictor
4.3 Future Propagation and Action Decoding
- Action token의 시점별 복제 및 결합
- 단일 Action token a~t′를 카메라 시점 개수인 V개만큼 복제하여 시점별 Action token a~v,t′v=1V를 생성함.
- 이를 예측된 미래 geometry token 뒤에 Concatenate 하여 GFM의 나머지 deep Layer들 (D>Ls)로 투입함.
Z~t′+1(M)=(f(M)∘⋅⋅⋅∘f(sL+1))([[Z~1,t′+1(Ls);a~1,t′],...,[Z~V,t′+1(Ls);a~V,t′]])
- 정보 유출 방지를 위해 이 단계의 Global Attention(fglobal(m)) Layer들에도 예측기의 casual masking strategy을 확장 적용함.
- 이중 헤드를 통한 최종 디코딩
- 가벼운 Action head(hact): Context Window 전반에서 전파된 Action token들을 집계하여 실제 로봇이 실행할 Action Chunk a^t′를 Regression
- 기존 GFM Depth Head(hdepth): 정제된 미래 geometry token을 받아, Action의 실행 결과와 공간적으로 일치하는 Future 3D Depth Maps를 디코딩함.
4.4 Training and Inference
5. Experiments
5.1 Implementation Details
- Backbone Model: Track4World 데이터셋으로 Fine-tune된 DA3-Giant Geometry Foundation Model을 기본 Backbone으로 사용함.
- 예측기 구조: Attention Mode가 교차하기 시작하는 12번째 Layer(Ls=12)에 hidden dimension dg=1024를 가진 12 Layer casual predictor를 삽입
- Context Window & Action: Pre-training 시에는 H=4, Post-training 시에는 H=1의 context horizon을 사용하며, 8단계의 Action Chunk(C=8)를 예측함
- 학습 방식: 784K개의 대규모 로봇 조작 trajectory 데이터로 Pre-train을 진행한 후, 각 시뮬레이션 및 로봇 벤치마크 데이터셋에서 End-to-End fine-tune을 수행함. 학습 시 Ls이전의 얕은 Layer들과 Depth head는 frozen하여 사전 학습된 기하학적 구조를 보존함.
5.2 시뮬레이션 벤치마크 결과(LIBERO 및 LIBERO-Plus)
- 기본 환경(In-distribution): 성능이 상향 평준화된 표준 LIBERO 벤치마크에서 97.6%의 높은 성공률을 기록하며 최첨단 모델들과 대등하거나 능가하는 성능을 보임.
- 환경 섭동(Out-of-distribution): 카메라 시점, 조명, 배경 등이 무작위로 변경되는 LIBERO-Plus 벤치마크에서 뛰어난 강건성을 입증함.
- 카메라 섭동(Camera Perturbation): 기존 최상위 VLA 모델인 π0.5 대비 9.7% 높은 성공률(83.1%)를 기록하며 압도적인 성능 우위를 달성함.
- other geometry perception VLA(Spatial Forcing, ROCKET) 모델들이 카메라 변형 시 성공률이 폭락하는 것과 달리, World Model 경로 전반에 GFM 구조를 내재화한 GAM은 성능 저하를 최소화함.

5.3 Real-World Results
- 하드웨어 구성: 하드웨어 스펙은 Wrist-mounted ZED 카메라와 3인칭 시점의 external RealSense 카메라를 혼합하여 사용함.
- 평가 Task: Pick & Place, milk box 및 cube stack, 냄비와 팬 인덕션에 올리기, 덮인 냄비에 큐브 넣기 등 총 4가지 복잡한 조작 작업을 수행함.
- robustness test: external 카메라를 85cm 이동시키고 45° 회전하는 강력한 시점 변형(OOD)환경을 구축함.
- 결과: 시뮬레이션과 동일하게 GAM은 인도메인(In-distribution)환경뿐만 아니라 카메라 위치가 완전히 뒤바뀐 OOD환경에서도 성공률 저하 없이 강한 성능을 유지하며, Spatial Forcing등의 베이스라인을 크게 압도함.

5.4 Ablation Study

5.5 연산 효율성 및 모델 크기 분석(Inference Cost & Size)
-
Latency
- 단일 GH200 GPU 기준, 확산 모델 기반의 Cosmos Policy(382.4ms) 대비 최대 55배 빠른 6.9ms(약 145Hz)의 초고속 속도로 동작함.
- Multi-step 디노이징 과정없이 Single-Pass Feed-forward 및 정적 연산을 위한 CUDA Graphs 최적화를 적용한 결과물임.
-
Model Size:
- LLM이나 Large Video Diffusion Model을 사용하지 않고 3D geometry backbone을 온전히 재활용했기 때문에 전체 파라미터 크기가 1.4B로 다른 Foundation Model에 비해 가벼움

6. Conclusion and Limitation
- GFM내부에서 World Modeling을 통해 기하학 구조와 로봇 액션 예측을 완벽히 통합한 Geometric Action Model(GAM)을 성공적으로 도입.
- GFM의 얕은 Layer와 깊은 layer 사이에 Causual Transformer를 삽입함으로써 Action과 future geometry를 Regressive하게 디코딩하고 기존 2D 기반 Foundation Model Policy들이 가졌던 Spatial 모호성을 해결함.