[논문 리뷰] Geometric Action Model for Robot Policy Learning

두부김치·2026년 7월 10일

논문 리뷰

목록 보기
20/26

Title : Geometric Action Model for Robot Policy Learning (ArXiv 2026)
논문 링크 : https://arxiv.org/pdf/2606.17046
Github: https://cvlab-kaist.github.io/Geometric-Action-Model/

1. Introduction

  • 자연어 지시를 따르고 다양한 환경에서 임의의 물체를 능숙하게 조작할 수 있는 범용 조작 정책(Generalist Manipulation Policies) 구축

  • 이를 위해 언어, 시각적 외형, 장면 기하학, 로봇 상태 및 물리적 역학(Dynamics)에 대한 통합된 이해가 필수적임.

  • 기존 Foundation Model 활용의 한계

    • VLA(Vision-Language-Action) Model: 시각-언어 모델을 로봇 액션에 매핑하지만, 2D 사전 지식(Priors)에만 의존하며 3D 이해도가 부족함.
    • WAM(Video World-Action Model): 비디오 생성 모델에 Prediction 능력을 활용해 미래 프레임과 액션을 공동 모델링하지만, 역시 2D 픽셀 공간에 머물러 있음.
    • 공통 한계: Depth, Scale, Occlusion 등의 3D 단서가 암시적으로만 남게 되어 환경 변화(특히 로봇 초기 상태 및 카메라 시점 변화)에 대한 일반화 능력이 크게 떨어짐.
  • 최근 3D Geometry 정보 도입 시도와 한계

    • raw PointCloud를 직접 학습하는 방식은 일반화에 유용하나 task별 인코더를 처음부터 학습해야함.
    • Geometric Foundation Model(GFM)의 특징을 VLA Backbone에 Distillation하거나, GFM 최종 Feature 위에 가벼운 action head를 붙이는 방식이 제안됨.
    • 한계 : GFM을 단순히 Static Feature Extractor로만 사용할 뿐, GFM의 다층 기하학적 구조 자체를 시간적 변화에 예측 및 액션 생성을 위한 자체 substrate로 직접 재활용하지 못함.

  • Proposed Method: GAM(Geometric Action Model)

    • GFM을 Perception, 미래 상태 예측, 액션 디코딩을 위한 '공유 매개체'로 직접 재활용하여 기하학적 World Dynamics를 로봇 정책에 내재화함.
    • 구조적 특징: Pretrained GFM을 Middle Layer에 Split하여 앞단은 Observation Encoder로 사용하고, 중간에 Causal Transformer를 삽입하여, 언어, 상태, 액션 히스토리기반의 미래 특징 표현을 예측한 뒤, 뒷단 Layer와 Action head를 통해 미래 Geometric과 Action을 동시에 출력함.
  • Contribution

    • Unified Backbone Architecture: temporal world Modeling, 잠재 특징 공간 예측, GFM substrate를 단일 공유 백본 아키텍처에 결합한 GAM 최초 도입
    • 공유 토큰 공간 예측: 액션과 미래 장면 예측이 분리된 헤드가 아닌 단일 autoregressive 토큰 시퀀스 내에서 모델링되어 1회의 forward pass로 액션과 미래 geometric을 모두 도출
    • 압도적 성능 및 효율성: 다양한 시뮬레이션 및 실제 로봇 조작 벤치마크에서 기존 거대 모델 대비 더 높은 정확도, 더 강력한 강건성, 적은 파라미터 수, 획기적으로 빠른 inference time(55배 빠름)을 동시에 달성
    • 기하학적 강건성 증명: 특히 기하학적 이해가 필수적인 Camera Perturbation 환경에서 9.7%라는 압도적인 성능 향상을 기록

2. Related Work

  • Vision-Language-Action(VLA)
    • Pretraining 된 VLM을 Fine-tune하여 로봇 액션 토큰을 autoregressive하게 decoding하거나, Flow matching, Diffusion Head 등을 연결해 액션을 출력함. 휴머노이드 및 다양한 Embodied 제어로 확장 중임.
    • Limitation: 2D 이미지 사전 지식에만 의존하여 3D 공간 이해도가 부족함. 최근 GFM 특징과 정렬(Alignment)하려는 시도가 있었으나 GFM 백본의 잠재력을 완전히 활용하지 못함.
  • World Action Models for Robot Manipulation
    • 기존 방식
      • Large Video Generation Model을 Fine-tune하여 미래 프레임과 액션을 공동 예측함.
      • 시각 백본은 고정하고 잠재 특징 공간에서 별도의 시간적 예측기를 학습시켜 MPC 등에 활용함.
    • Limitation: 두 방식 모두 2D 픽셀/이미지 공간 기반의 비디오 백본을 사용하므로 Depth, Scale, Occlusion 문제를 명시적으로 해결하지 못함.
    • GAM의 차별점: 풍부한 3D 사전 지식을 가진 GFM의 Latent Space 내부에서 미래를 예측함.
  • Geometric Foundation Models, GFMs)
    • 기존 방식: Multi-View Image에서 3D 구조를 추론하는 GFM(ex: VGGT, Depth Anything3)을 로봇 정책의 동결된 feature extractor, 인코더 대체, 혹은 Pointcloud 융합용으로 사용함.최근 액션과 3D 속성을 공동 예측하거나, diffusion 기반으로 미래 3D latent token을 함께 De-nosing하는 동시 연구들이 존재.
    • GAM: 별도의 Head나 Diffusion 과정없이 단일 Autoregressive 시퀀스 내에서 액션과 미래 장면 예측을 함께 모델링.
    • GFM의 Deep blocks들을 단순히 관측 특징 처리용이 아니라, World Model이 예측한 미래 토큰을 디코딩하는 주체로 직접 재활용

3. Preliminaries: Geometric Foundation Models

  • GFM(Geometric Foundation Model)의 정의 및 목적

    • VGGT나 Depth Anything3와 같은 GFM은 하나 이상의 RGB이미지 입력을 받아 밀도가 높은(Dense) 3D Geometric 정보로 매핑하는 Feed-forward transformer 구조임.
  • 입력 데이터의 처리 및 토큰화(Tokenization)

    • 시점(View)의 개수를 VV라 할 떄, VV개의 시점 이미지 시퀀스를 I={Iv}v=1V\mathcal{I} = \{I_{v}\}_{v=1}^{V} 로 정의함(IvR3×h×wI_{v} \in \mathbb{R}^{3 \times h \times w}).
    • 각 이미지 IvI_v는 크기 p×pp \times p를 가진 PP개의 겹치지 않는 patch(Non-overlapping patches)로 분할됨.
    • patch embedding을 통해 각 시점은 다음과 같은 시점별 token sequence zv(0)z_v^{(0)}로 투영됨.
      zv(0)=[cv,xv1,...,xvP]R(1+P)×dz_{v}^{(0)}=[c_{v},x_{v}^{1},...,x_{v}^{P}]\in\mathbb{R}^{(1+P)\times d}
    • cvc_v: 시점별 카메라 토큰
    • {xvj}j=1P\{x_{v}^{j}\}_{j=1}^{P}: 패치 토큰
    • dd: 은닉 차원(Hidden dimension)
    • 모든 시점의 토큰을 이어 붙인 전체 입력 시퀀스 z(0)z^{(0)}는 다음과 같음
      Z(0)=[z1(0),...,zV(0)]RV(1+P)×dZ^{(0)}=[z_{1}^{(0)},...,z_{V}^{(0)}]\in\mathbb{R}^{V(1+P)\times d}
  • 트랜스포머 블록 연산 및 어텐션 모드

    • 토큰들은 총 MM개의 트랜스포머 블록 스택 f(m)m=1M{f^{(m)}}_{m=1}^{M}을 통과하며, 다음 두가지 Attention Mode 중 하나를 사용함.
      • 프레임별 어텐션(Frame-wist attention, fframe(m)f_{frame}^{(m)}): 각 시점의 토큰 내부에서만 독립적으로 작동하며, 단일 이미지의 (1+P)(1+P)개 토큰들 사이에서만 어텐션을 수행함.
      • 전역 어텐션(Global attention, fglobal(m)f_{global}^{(m)}): 모든 V(1+P)V(1+P)개 토큰에 대해 공동으로 작동하여 여러 시점(ViewPoint)간의 정보를 융합함.
    • mm번째 트랜스포머 블록을 거친 Hidden State Z(m)Z^{(m)}은 다음과 같이 업데이트 됨
      Z(m)=f(m)(Z(m1))(f(m){fframe(m),fglobal(m)})Z^{(m)}=f^{(m)}(Z^{(m-1)}) \quad \left(f^{(m)}\in\{f_{frame}^{(m)},f_{global}^{(m)}\}\right)
  • 3D 기하학 정보 디코딩

    • 트랜스포머의 Forward Pass가 완료되면, 선택된 레이어들의 집합 S=m1,m2,m3,m4\mathcal{S}={m_{1},m_{2},m_{3},m_{4}}에 해당하는 Multi-layer hidden states Z(m)Z^{(m^{*})}를 추출함.
    • Multi-layer hidden states들을 DPT(Dense Prediction Transformer) 헤드에 입력하여 최종 기하학적 수치를 추론함.
      • 시점별 픽셀 단위 깊이(Per-pixel depth): DwRh×wD_{w}\in\mathbb{R}^{h\times w}
      • 3D Point Maps: PvR3×h×wP_{v}\in\mathbb{R}^{3\times h\times w}
      • 보조 헤드를 통한 각 시점별 카메라 내부/외부 파라미터(Camera Parameters): (Kv,ξv)R3×3×SE(3)(K_{v},\xi_{v})\in\mathbb{R}^{3\times3}\times SE(3)

4. GAM: Geometric Action Model

4.1 문제 정의(Problem Formulation)

  • 목표: Language-conditioned robot manipulation)을 수행하는 Policy πθ\pi_{\theta}을 학습하는 것

  • 입력 데이터(매 Timestep tt마다 수집):

    • ot={Iv,t}v=1Vo_t = \{I_{v,t}\}_{v=1}^{V}: 고정된 VV개의 카메라로부터 얻은 Multi-View RGB관측치
    • stRdss_t \in \mathbb{R}^{d_s} : 로봇의 관절 구성 및 말단 효과기(End-effector) 포즈를 나타내는 Proprioceptive state
    • ll: 에피소드 내내 일정하게 유지되는 task instruction
  • 출력 데이터
    - a^tRC×da\hat{a}_t \in \mathbb{R}^{C \times d_a}: 길이 CC를 가지는 Action Chunk로 다음 관측치를 얻기 전까지 Open-loop로 실행할 CC개의 Δ\Delta Pose 또는 관절 명령을 인코딩함.
    - 정책 함수 정의(Context Window HH 반영):

    πθ:({otH+1,...,ot},{stH+1,...,st},{atH,...,at1},l)a^t\pi_{\theta}:(\{o_{t-H+1},...,o_{t}\},\{s_{t-H+1},...,s_{t}\},\{a_{t-H},...,a_{t-1}\},l)\mapsto\hat{a}_{t}
  • 데이터셋: NN개의 expert demonstration D=(τi,li)i=1N\mathcal{D}={(\tau_{i},l_{i})}_{i=1}^{N} 로부터 학습을 진행함.

  • 전체 아키텍처 개요(Overview)

    • Pretrained GFM을 특정 Layer에서 반으로 쪼개고, 그 사이에 Causal Temporal Predictor를 삽입한 구조
    • 미래 예측과 모든 제어 연산이 외부 공간이 아닌, GFM 고유의 3D 기하학적 Latent Space 내부에서 수행되도록 설계함.

4.2 Observation Encoder

  • GFM Backbone 분리(Split)
    • GFM 트랜스포머 stack을 split Layer LsL_s를 기준으로 Encoder(ELsE_{\le L_s}), Decoder(D>LsD_{>L_s})로 Split함.
      ELs=f(Ls)f(1),D>Ls=f(M)...f(Ls+1)E_{\le L_{s}}=f^{(L_{s})}\circ\cdot\cdot\cdot\circ f^{(1)}, \quad D_{>L_{s}}={f^{(M)}}\circ...\circ f^{(L_{s}+1)}
  • Split Layer LsL_s 선정의 제약 조건
    • 원본 RGB로부터 충분히 풍부한 visual feature을 추출할 수 있을 만큼 깊어야 함.
    • 하지만 GFM의 뎁스 헤드(DPT)가 사용하는 가장 첫 번째 Layer m1m_1보다는 얕아야 함.(Ls<m1L_s < m_1). 그래야 예측된 미래 잠재 토큰들이 뎁스 헤드를 통해 3D Geometric image로 디코딩될 수 있기 때문임.
  • 인코딩 연산 과정
    • Context 윈도우 내의 각 타임스텝 tt'에 대해, 멀티뷰 RGB 관측치 oto_{t'}를 GFM 패치 임베딩으로 토큰화하여 초기 시퀀스 Zt(0)Z_{t'}^{(0)}를 생성함.
    • 이를 앞단 인코더 ELsE_{\le L_s}에 통과시켜 타임스텝별 기하학적 잠재 상태의 시퀀스를 획득함.
      {ZtH+1(Ls),...,Zt(Ls)}\{Z_{t-H+1}^{(L_s)}, ..., Z_{t}^{(L_s)}\}

4.3 Causal Future Predictor

  • Token Block 생성 및 결합

    • Timestep tt'의 Proprioception sts_{t'}와 이전 액션 at1a_{t'-1}을 가벼운 Projection Layer at1a_{t'-1}을 가벼운 프로젝션 레이어(ψs,ψa\psi_s, \psi_a)를 통해 토큰화 함.
      pt=ψs(st),qt=ψa(at1)p_{t^{\prime}}=\psi_{s}(s_{t^{\prime}}), \quad q_{t^{\prime}}=\psi_{a}(a_{t^{\prime}-1})
    • Language Instruction ll은 Pretrained 된 고정 텍스트 인코더(T5)를 통해 언어 토큰 LlL_l로 변환됨.
    • Geometric 토큰과 결합하여 Timestep별 Token Block UtU_{t'}를 형성하고, 이를 시간 순으로 이어붙여 예측기의 전체 입력 시퀀스 XX를 구성함.
      Ut=[pt;qt;Zt(Ls)],X=[Ll;UtH+1;...;Ut]U_{t^{\prime}}=[p_{t^{\prime}};q_{t^{\prime}};Z_{t^{\prime}}^{(L_{s})}], \quad X=[L_{l};U_{t^{\prime}-H+1};...;U_{t^{\prime}}]
  • block-causal Self-attention

    • 미래 정보가 과거/현재로 유출(Future Leakage)되는 것을 막기 위해 특별한 Masking Strategy를 사용함. 동일 timestep block내의 Token들은 서로 자유롭게 attention하되, 미래 timestep의 Block은 볼 수 없도록 제한함.
  • 공유 토큰 공간에서의 공동 예측(Joint Prediction)

    • 예측기 gϕg_{\phi}의 마지막 Layer Output 중 Geometry Slots에서는 미래 프레임의 latent token인 Z~t+1(Ls)\tilde{Z}_{t'+1}^{(L_s)}을 예측함.
    • 동시에, 지정된 '이전 액션 슬롯'의 hidden state를 projection하여 예측된 다음 액션 토큰 a~t\tilde{a}_{t'}을 생성함.(언어 모델의 Next-token prediction과 유사한 방식)
    • 이를 통해 단 한번의 Forward-pass로 액션과 미래 물리 세계의 변화가 긴밀하게 상호작용하도록 만듦

4.3 Future Propagation and Action Decoding

  • Action token의 시점별 복제 및 결합
    • 단일 Action token a~t\tilde{a}_{t'}를 카메라 시점 개수인 VV개만큼 복제하여 시점별 Action token a~v,tv=1V{\tilde{a}_{v,t'}}_{v=1}^{V}를 생성함.
    • 이를 예측된 미래 geometry token 뒤에 Concatenate 하여 GFM의 나머지 deep Layer들 (D>LsD_{>L_s})로 투입함.
      Z~t+1(M)=(f(M)f(sL+1))([[Z~1,t+1(Ls);a~1,t],...,[Z~V,t+1(Ls);a~V,t]])\tilde{Z}_{t^{\prime}+1}^{(M)}=(f^{(M)}\circ\cdot\cdot\cdot\circ f^{(s_L+1)})([[\tilde{Z}_{1,t^{\prime}+1}^{(L_{s})};\tilde{a}_{1,t^{\prime}}],...,[\tilde{Z}_{V,t^{\prime}+1}^{(L_{s})};\tilde{a}_{V,t^{\prime}}]])
    • 정보 유출 방지를 위해 이 단계의 Global Attention(fglobal(m)f_{global}^{(m)}) Layer들에도 예측기의 casual masking strategy을 확장 적용함.
  • 이중 헤드를 통한 최종 디코딩
    • 가벼운 Action head(hacth_{act}): Context Window 전반에서 전파된 Action token들을 집계하여 실제 로봇이 실행할 Action Chunk a^t\hat{a}_{t'}를 Regression
    • 기존 GFM Depth Head(hdepthh_{depth}): 정제된 미래 geometry token을 받아, Action의 실행 결과와 공간적으로 일치하는 Future 3D Depth Maps를 디코딩함.

4.4 Training and Inference

  • 최종 Multi-task Objective

    Ltotal=λactLact+λfeatLfeat+λdepthLdepth\mathcal{L}_{total}=\lambda_{act}\mathcal{L}_{act}+\lambda_{feat}\mathcal{L}_{feat}+\lambda_{depth}\mathcal{L}_{depth}
    • Action Loss(Lact\mathcal{L}_{act}): 디코딩된 Action Chunk와 Expert data의 실제 Action 간의 l1l_1 정밀 회귀 손실.
    • Future feature Loss(Lfeat\mathcal{L}_{feat}): 예측된 미래 잠재 토큰과, 실제 다음 프레임을 고정된 GFM Backbone에 넣었을 때 실제 Latent token간의 거리를 좁혀서 World Model의 정밀도를 잡는 Loss
      Lfeat=tHZ~t+1(Ls)Zt+1(Ls)1\mathcal{L}_{feat}=\sum_{t^{\prime}\in\mathcal{H}}||\tilde{Z}_{t^{\prime}+1}^{(L_{s})}-Z_{t^{\prime}+1}^{(L_{s})}||_{1}
    • Future Depth Loss(Ldepth\mathcal{L}_{depth}): 디코딩된 Depth 정보를 실제 Future Depth(GT)와 비교하며, GFM 고유의 스케일 불변 및 그레디언트 매칭 패널티를 적용하여 올바른 3D 구조를 강제함.
  • 추론 단계 최적화(Online Inference with KV Caching)

    • 추론 시에는 Key-Value Caching을 통해 과거 context를 online으로 유지함,
    • 따라서 매 step마다 전체 시퀀스를 다시 계산할 필요 없이, 새로 들어온 Observation oto_t와 직전 action at1a_{t-1}만 단 한번의 Single feed-forward pass로 처리하므로 지연 시간을 줄임.

5. Experiments

5.1 Implementation Details

  • Backbone Model: Track4World 데이터셋으로 Fine-tune된 DA3-Giant Geometry Foundation Model을 기본 Backbone으로 사용함.
  • 예측기 구조: Attention Mode가 교차하기 시작하는 12번째 Layer(Ls=12L_s=12)에 hidden dimension dg=1024d_g=1024를 가진 12 Layer casual predictor를 삽입
  • Context Window & Action: Pre-training 시에는 H=4H=4, Post-training 시에는 H=1H=1의 context horizon을 사용하며, 8단계의 Action Chunk(C=8C=8)를 예측함
  • 학습 방식: 784K개의 대규모 로봇 조작 trajectory 데이터로 Pre-train을 진행한 후, 각 시뮬레이션 및 로봇 벤치마크 데이터셋에서 End-to-End fine-tune을 수행함. 학습 시 LsL_s이전의 얕은 Layer들과 Depth head는 frozen하여 사전 학습된 기하학적 구조를 보존함.

5.2 시뮬레이션 벤치마크 결과(LIBERO 및 LIBERO-Plus)

  • 기본 환경(In-distribution): 성능이 상향 평준화된 표준 LIBERO 벤치마크에서 97.6%의 높은 성공률을 기록하며 최첨단 모델들과 대등하거나 능가하는 성능을 보임.
  • 환경 섭동(Out-of-distribution): 카메라 시점, 조명, 배경 등이 무작위로 변경되는 LIBERO-Plus 벤치마크에서 뛰어난 강건성을 입증함.
    • 카메라 섭동(Camera Perturbation): 기존 최상위 VLA 모델인 π0.5\pi_{0.5} 대비 9.7% 높은 성공률(83.1%)를 기록하며 압도적인 성능 우위를 달성함.
    • other geometry perception VLA(Spatial Forcing, ROCKET) 모델들이 카메라 변형 시 성공률이 폭락하는 것과 달리, World Model 경로 전반에 GFM 구조를 내재화한 GAM은 성능 저하를 최소화함.

5.3 Real-World Results

  • 하드웨어 구성: 하드웨어 스펙은 Wrist-mounted ZED 카메라와 3인칭 시점의 external RealSense 카메라를 혼합하여 사용함.
  • 평가 Task: Pick & Place, milk box 및 cube stack, 냄비와 팬 인덕션에 올리기, 덮인 냄비에 큐브 넣기 등 총 4가지 복잡한 조작 작업을 수행함.
  • robustness test: external 카메라를 85cm 이동시키고 45° 회전하는 강력한 시점 변형(OOD)환경을 구축함.
  • 결과: 시뮬레이션과 동일하게 GAM은 인도메인(In-distribution)환경뿐만 아니라 카메라 위치가 완전히 뒤바뀐 OOD환경에서도 성공률 저하 없이 강한 성능을 유지하며, Spatial Forcing등의 베이스라인을 크게 압도함.

5.4 Ablation Study

  • Component Analysis

    • Pre-training의 중요성: 대규모 로봇 데이터 프리트레이닝을 생략할 경우 기본 LIBERO 성능은 유지되나, OOD 환경인 LIBERO-Plus 성능이 심각하게 저하됨.(89.7% \rightarrow 73.4%)
    • 보조 손실 함수의 역할: 기하학 사전 지식이 이미 인코딩되어 있어 Pre-training된 backbone 상태에서는 Depth Loss(Ldepth\mathcal{L}_{depth})이나 feature Loss(Ldepth\mathcal{L}_{depth})을 제거해도 성능 변화가 거의 없음. 다만, Pre-training이 없는 기본 상태(Scratch)에서는 이 미래 Prediction Loss들이 강력한 3D Supervised 신호로 작용하여 일반화 성능을 대폭 끌어올림(50.0% \rightarrow 89.0%)
  • Split Layer (LsL_s)선정 분석

    • GFM의 총 40개 Block 중 12번째 Block(Ls=12L_s=12)에서 Peak 성능을 달성함.
    • 너무 앞단(Ls=0L_s=0)이나 후반부(Ls27L_s \ge 27)에 예측기를 삽입할 경우, 예측된 토큰이 GFM의 깊은 레이어를 거치며 정제될 기회를 잃거나 기하학적 사전 지식과 상호작용이 깨져 성능이 완전히 붕괴(0 1.80~1.8%)
  • 액션 토큰 통과 시점

    • 예측기 아웃풋에서 액션을 즉시 출력하는 방식(Direct-action Supervision)보다, 예측된 액션 토큰을 GFM의 남은 깊은 레이어들(D>LsD_{>L_s})에 통과시켜 함께 Decoding하는 GAM의 기본 방식이 카메라 섭동 환경에서 훨씬 정교한 제어 성능을 보임 (84.1% \rightarrow 89.7%)

5.5 연산 효율성 및 모델 크기 분석(Inference Cost & Size)

  • Latency

    • 단일 GH200 GPU 기준, 확산 모델 기반의 Cosmos Policy(382.4ms) 대비 최대 55배 빠른 6.9ms(약 145Hz)의 초고속 속도로 동작함.
    • Multi-step 디노이징 과정없이 Single-Pass Feed-forward 및 정적 연산을 위한 CUDA Graphs 최적화를 적용한 결과물임.
  • Model Size:

    • LLM이나 Large Video Diffusion Model을 사용하지 않고 3D geometry backbone을 온전히 재활용했기 때문에 전체 파라미터 크기가 1.4B로 다른 Foundation Model에 비해 가벼움

6. Conclusion and Limitation

  • GFM내부에서 World Modeling을 통해 기하학 구조와 로봇 액션 예측을 완벽히 통합한 Geometric Action Model(GAM)을 성공적으로 도입.
  • GFM의 얕은 Layer와 깊은 layer 사이에 Causual Transformer를 삽입함으로써 Action과 future geometry를 Regressive하게 디코딩하고 기존 2D 기반 Foundation Model Policy들이 가졌던 Spatial 모호성을 해결함.
profile
Robotics

0개의 댓글