[논문 리뷰]StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision

두부김치·2026년 7월 27일

논문 리뷰

목록 보기
21/26

Title : StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision (ArXiv 2026)
논문 링크 : https://arxiv.org/pdf/2512.21970
blog: https://shengliangd.github.io/StereoVLA-Webpage/

1. Introduction

  • 연구 배경 및 기존 VLA 모델의 한계:

    • VLA모델의 발전과 한계:
      • 최근 VLA모델들은 사전 학습된 VLM을 활용하여 시연(Demonstration)으로부터 다양한 스킬을 효과적으로 습득하고 강력한 Semantic reasoning능력을 보임.
      • 그러나 OpenVLA등 기존의 VLA모델들은 단일 뷰(Single-view) RGB입력에만 의존하고 있어, 정밀한 공간 인식(Fine-grained spatial awareness)과 시점 강건성(Viewpoint robustness)에 한계가 있음.
      • 따라서 VLA 모델에 풍부한 기하학적 단서(Geometric cues)를 제공하는 것이 핵심 도전 과제로 남아 있음.
  • 기존 공간/기하학적 보조 센서 설정의 문제점

    • 기존 연구들은 3차원 공간 인식을 보완하기 위해 세가지 유형의 추가 센서를 탐색했으나 각각 명확한 구조적 한계를 가짐.
      • 손목 부착 카메라(Wrist-mounted cameras)
        • 시야각이 제한적이고 주변 환경에 의해 쉽게 가려짐(Occluded)
        • 로봇 암에 하드웨어가 추가되므로 환경과의 충돌 위험(Collision risk)을 증가시킴.
      • 깊이 센서(Depth sensors)
        • 표면 재질(투명, 반사, 광흡수 소재 등)이나 외부 조명 조건(강한 태양광 등)에 의해 신뢰성이 떨어지고 심한 노이즈가 발생함.
      • 추가 3인칭 카메라(Extra third-person cameras):
        • 상호 보완적인 정보를 제공하지만, 모바일 로봇이나 휴머노이드에 적용하기에는 하드웨어 구성이 복잡해짐.
        • 시점 다양성이 증가함에 따라 오히려 모델의 시점 강건성을 저해하는 결과를 초래함.
      • 기존 설정들은 체화된 조작(Embodied manipulation)을 위한 양안 시각(Stereoscopic perception)을 명시적으로 제공하지 못하며, 이러한 인지적 단서에 잘 정렬된 학습 방법론도 부재함.
  • 문제 해결을 위한 접근 방법

    • 비전 인코더의 재고:
      • 대부분의 기존 VLA 모델은 사전 학습된 RGB 비전 인코더에 의존하는데, 이는 명시적인 기하학적 정보 표현력이 부족하고 기하학적 표현보다 Semantic alignment을 우선시함.
      • 로봇이 지시를 이해하는 것을 넘어 다양한 형태와 위치를 가진 객체와 정밀하게 상호작용하려면, 의미적 정보와 기하학적 정보를 공동으로 인코딩하는 효과적인 시각적 표현이 필수적임.
    • 스테레오 입력 직접 적용 시의 한계
      • 현재 SOTA VLA 아키텍쳐(π0.5\pi_{0.5})기반의 기존 RGB 인코더를 스테레오 입력에 단순 적용하는 것은 효과적이지 않음.
      • 그 이유는 기존 RGB 인코더가 기하학적 표현보다 의미적 정렬을 우선시하기 때문이며, 스테레오 입력이 포함된 대규모 로봇 데이터를 실제 환경에서 수집하는 것이 매우 노동 집약적이기 때문.
  • 제안 방법

    • 본 논문은 대규모 합성 스테레오 데이터로부터 풍부한 기하학적 단서를 통합한 최초의 VLA모델인 StereoVLA를 제안하며, 세 가지 핵심 해결책을 도입함.
    • GeoSem(Geometric-and-Semantic) 비전 인코더 설계:
      • 미세한 Stereo view Disparity로부터 정밀한 공간 인식을 위한 기하학적 단서를 추출하고, 동시에 언어 조건부 조작을 지원하기 위해 픽셀 관측으로부터 Semantic features을 포착함.
      • 구체적으로 수백만 개의 스테레오 쌍으로 SOTA Depth Estimation 모델인 FoundationStereo의 기하학 중심 특징을 활용하고, 이를 PrismaticVLM의 의미적으로 풍부한 토큰과 공간적으로 정렬 및 융합하여 기하학적 정밀도와 의미적 풍부함을 결합한 하이브리드 토큰을 생성함.
    • 대규모 합성 스테레오 데이터 전이(Sim-to-Real)
      • 제한된 스테레오 데이터 문제를 해결하기 위해 현대적인 고정밀 Simulator와 foundation 모델을 결합하여 5백만 개의 합성 Stereo trajectory dataset을 생성함.
      • 시각적/물리적 갭을 완화하기 위해 광범위한 도메인 무작위화(Domain randomization)와 준정적(Quasi-static) 가정을 적용함.
      • 특히 현대 렌더링 기술은 RGB실사화에는 뛰어나지만 센서 특유의 Depth아트팩트를 복제하는 데는 한계가 있으므로, 스테레오 시야가 기하학적 Sim-to-Real 전이에 훨씬 더 간겅한 모달리티임을 관찰하고 활용함.
    • 시점 간겅성을 위한 공동 학습(Co-training)태스크:
      • 인식-행동 매핑을 '카메라 좌표계의 공간 인식'과 로봇 좌표계의 행동 생성'으로 분리하고, 두 가지 보조 태스크를 공동 학습시킴.
      • 상호작용 영역 깊이 추정(Interaction-Region Depth Estimation): 무의미한 배경 대신 상호작용 영역 내의 깊이를 예측하도록 유도하여 작업 관련 공간 디테일을 학습시킴.
      • 카메라 파라미터 추정(Camera Parameter Esitmation): 모델이 카메라 파라미터를 추론하게 함으로써 카메라 좌표계와 로봇 좌표계 간의 매핑을 암묵적으로 시킴.
  • Contribution

    • 스테레오 센싱, 스테레오 인지 표현 학습, 보조 기하학적 지도 학습, 대규모 합성 데이터 사전 학습을 통합하여 강건하고 정밀한 조작을 달성하는 기하학 인식 VLA를 제시
    • 스테레오 입력으로부터 밀도 높은 의미적 특징과 기하학적 특징을 모두 담은 시각 토큰을 생성하는 GeoSem 비전 인코더를 도입함.
    • 시점 강건석이 강화된 인식-행동 매핑을 촉진하기 위해 상호작용 영역 깊이 추정 및 카메라 파라미터 추정 Co-training task를 제안함.
    • 제안한 접근 방식이 기존 VLA모델보다 성능 향상이 확인되었고, 카메라 Pose 변화에도 강건함을 보임.

2. Related Work

2.1 Vision-Language-Action(VLA) 모델

  • 행동 예측 방식의 진화: 초기 VLA 모델(RT-2, OpenVLA)은 행동을 토큰화하여 이산적( Discretized)으로 예측했으나, 최근 모델들(π0,π0.5\pi_0, \pi_{0.5} 등)은 부드러운 궤적 생성을 위한 확산(Diffusion)이나 플로우 매칭(FLow-based)정책을 채택하는 추세임.
  • 카메라 설정의 한계: VLA의 센서 설정이 단일 RGB에서 손목 부착, 다중 View 등으로 확장되었으나, 양안 시차(Disparity)를 통해 기하학적 정보를 명시적으로 제공하는 '스테레오 카메라'를 본격적으로 활용한 VLA없었음.
  • 합성 데이터의 대두: 데이터 수집 비용을 줄이기 위해 합성 데이터와 시뮬레이션 기반 학습이 VLA의 핵심 확장 도구로 떠오르고 있으며, Sim-to-Real 전이 연구가 활발히 진행 중임.

2.2 기하학 단서(Geometry Cues)를 활용한 로봇 학습

  • 3D 표현의 중요성: 단일 카메라의 한계를 극복하기 위해 포인트 클라우드, 깊이(Depth), 3D Reconstruction 등의 기하학적 정보를 도입하는 연구(DP3, iDP3 등)가 증가하며 공간 강건성을 높이고 있음.
  • 기존 기하학 융합 VLA의 한계: PointVLA, BridgeVLA 등 최근 VLA에 3D 단서를 주입하려는 시도가 있었으나, '명시적인 기하학적 정보'와 '사전 학습된 2D 파운데이션 모델의 풍부한 의미적(Semantic) 표현'을 어떻게 최적으로 융합할 것인가는 여전히 해결되지 않은 문제로 남아 있음.

2.3스테레오 인식 및 로봇 조작 정책

  • 스테레오 매칭 기술 발전: 무거운 3D CNN 기반의 Cost Volume연산에서 반복적 정제(Iterative refinement)방식으로 발전했으며, 최근 FoundatinoStereo와 같은 일반화 능력이 뛰어난 대규모 Stereo foundation model이 등장함.
  • 본 연구의 차별점: 기존 로봇 분야의 스테레오 활용 연구(SimNet, DextrAH-RGB 등)는 비교적 소규모 모델이나 단순 정책에 한정되어있음. 본 논문은 스테레오 인식을 대규모 VLA 모델로 확장하여, 모델의 막대한 용량과 Vision-Language Gounding 능력을 결합해 강력한 공간 인식 및 범용 조작 능력을 달성한다는 점에서 차별화 됨.

3. Method

3.1 Overall Architecture

  • 입력 및 인코딩: 스테레오 이미지 쌍을 제안하는 GeoSem 비전 인코더를 통해 기하학적 정밀도와 의미적 풍부함을 모두 담은 비주얼 토큰으로 변환함.
  • Vision-Langauge 통합 추론: 추출된 visual token은 text token과 함께 pre-train된 대형 언어 모델(LLM)인 InternLM-1.8B로 전달되어 결합 처리됨.
  • Action Generation: LLM의 중간 Vision-Language 특징(Key-Value Cache)을 활용하여, 300M(3억) 파라미터 규모의 Action Expert가 Flow-Mathcing을 통해 Delta End-Effector Pose 기반의 Action Chunk를 예측함.
  • Co-training: Inference latency를 증가시키지 않으면서 시점 강건성을 높이기 위해, 행동 예측과 함께 상호작용 영역 깊이 추정과 카메라 파라미터 추정이라는 두 가지 보조 테스크를 공동 학습시킴.

3.2 GeoSem(Geometric-and-Semantic) 비전 인코더

  • 스테레오 이미지 쌍(Il,IrRH×W×3I_l, I_r \in \mathbb{R}^{H \times W \times 3})으로부터 기하학적 특징과 의미적 특징을 각각 최적화된 파운데이션 모델에서 추출하고 결합하는 핵심 모듈임.

3.2.1 기하학적 특징 추출(Geometric Feature Extraction)

  • FoundationStereo 모델 활용: 수백만 개의 스테레오 쌍으로 학습된 SOTA 깊이 추정 파운데이션 모델인 FoundationStereo를 Frozen 상태로 활용함.
  • 특징 선정 기준 2가지: (1) 풍부한 기하학적 정보를 담은 밀도 높은 특징 볼륨(Dense feature volumes)일 것, (2) 깊이 추정을 위한 추가 연산을 최소화 할 것
  • 최적 특징으로 VcV_c^{'}(필터링된 코스트 볼륨) 선택 및 이유:
    • FoundationStereo는 좌우 단안 특징(fl,frf_l,f_r)을 연결한 4D 코스트 볼륨(VcV_c)에 Attention 기반 하이브리드 코스트 필터링을 적용하여 필터링된 코스트 볼륨 VcRC×D4×H4×W4V'_c \in \mathbb{R}^{C \times \frac{D}{4} \times \frac{H}{4} \times \frac{W}{4}} 를 생성
    • 반복적 정제(Iterative refinement) 단계는 상당한 연산 오버헤드를 유발하므로 과감히 제외함.
    • 상관 볼륨(VcorrV_{corr})은 밀도 높은 특징이 아닌 단순 매칭 점수이므로 제외함.
    • 원시 코스트 볼륨(VcV_c)대신 VcV_c^{'}를 선택한 이유는, 필터링 모듈을 통해 Long-range 공간 상관관계가 반영된 밀도 높은 기하학적 특징을 제공하여 로봇 조작에 결정적인 역할을 하기 때문임.

3.2.2 의미적 특징 추출(Semantic Feature Extraction)

  • 의미적 정보의 필요성: FoundationStereo는 깊이 추정에 특화되어 있어 Vision-Langauge Grounding에 필요한 고순준 의미 및 외형 정보가 부족함.
  • SigLIP + DINOv2 조합(PrismaticVLM 방식):
    • Vision-Langauge 대조 학습된 SigLIP을 통해 고수준 의미 정보를 포착함.
    • 자기지도 학습된 DINOv2를 통해 미세한 시각적 디테일 및 위치 정렬 정보를 포착함.
  • Left View 적용을 통한 연산 고속화: 좌우 뷰 영상 간의 의미 정보는 중복성이 매우 높으므로, 연산 효율성을 위해 좌측 뷰(IlI_l)에만 SigLIP과 DINOv2를 적용함.

3.2.3 특징 융합(Feature Fusion)

  • Spatial Pooling: FoundationStereo 특징의 공간 해상도를 SigLIP/DINOv2의 14-Pixel stride 해상도에 맞추기 위해 공간 풀링을 적용함.
  • 채널 방향 연결(Channel-wise Concatenation):토큰 시퀀스 방향으로 연결할 경우 토큰 수가 2배로 늘어나 학습 및 추론 시 연산량이 급등하므로, 특징 맵을 채널 차원을 따라 연결하여 단일 토큰 시퀀스로 융합함.

3.3 시점 강건성을 위한 공동 학습(Co-training)태스크

  • 기존 VLA를 '블랙박스'로 다루는 대신 인식-행동 매핑을 '카메라 좌표계 기반 공간 인식'과 '로봇 좌표계 기반 행동 생성'으로 분리하여 학습함. 이 보조 태스크들은 학습 시에만 적용되므로 추론 속도 저하가 없음.

3.3.1 상호작용 영역 깊이 추정(Interaction-Region Depth Estimation)

  • 작업 인식 샘플링(Task-aware Sampling): 이미지 전체에서 균일 샘플링하면 작업과 무관하게 배경(벽 등)이 주로 샘플링됨. 따라서 그리퍼와 타겟 객체의 2D 바운딩 박스로 정의되는 상호작용 영역 내에서 좌표 (x,y)(x,y)를 집중 샘플링하여 모델이 국소적 공간 관계에 집중하고 학습 수렴을 돕도록 함.
  • 텍스트 생성 방식의 깊이 예측: "What is the depth at (x,y)(x,y)?"프롬프트에 대해 연속적인 깊이 값(dd)을 텍스트 스트링으로 생성하도록 질문-응답 형태로 학습시킴. 이를 통해 별도의 회귀 헤드 없이 VLM의 기존 구조와 사전 학습된 지식을 그대로 유지하며 크로스 엔트로피 손실(Ldepth\mathcal{L}_{depth})로 학습함.

3.3.2 카메라 파라미터 추정(Camera Parameter Estimation)

  • 기하학적 매핑의 암묵적 학습: 본 연구의 설정은 반구형(Near-hemispheric)범위의 카메라 시점 변화를 다루므로, 카메라와 로봇 간의 공간 관계 추론이 필수적임.
  • 외부 및 내부 파라미터 예측: "What are the camera extrinsics and intrinstic?" 프롬프트를 통해 로봇 좌표계 기준의 카메라 외부 파라미터 TcameraRobotT_{camera}^{Robot}(이동 x,y,zx,y,z 및 오일러 회전 roll, pitch, yaw)와 내부 파라미터 K(fx,fy,cx,cy)K (f_x, f_y, c_x, c_y)를 텍스트 스트링으로 생성하도록 크로스 엔트로피 손실(Lcamera\mathcal{L}_{camera})로 공동 학습함.
  • 효과: 카메라 포즈 변화 하에서 카메라 인지적 표현 학습을 유도하여, 모델 스스로 카메라-로봇 좌표계 매핑을 암묵적으로 학습하고 단일 스텝 시각 입력만으로도 시점 변화에 강건해짐.

3.4 데이터셋 Curation 및 Sim-to-Real 전이

  • 5M 규모의 합성 스테레오 궤적 생성: 기존 Open Dataset(Open-X 등)에 스테레오 데이터가 부재한 점을 극복하기 위해, 고정밀 시뮬레이터와 파운데이션 모델을 연계하여 500만 개의 스테레오 데이터셋을 구축함. TableTop Franka 및 휴머노이드 로봇을 포괄하여 형태학적 범용성을 확보함.
  • Visual Gap 완화 전략(3가지 설계): (1) 강력한 파운데이션 특징 유지를 위해 사전 학습된 비전 인코더 동결, (2) 실제 이미지 분포와의 정렬을 위해 GRIT 데이터셋 기반 2D 바운딩 박스 예측 동동 학습, (3) Ray-traced 렌더링 및 광범위한 조명/텍스처/카메라 파라미터 도메인 무작위화 적용
  • 스테레오 모달리티의 Sim-to-Real 우위: 시뮬레이션의 RGB 실사화는 뛰어나지만 깊이(Depth) 센서 특유의 물리적 노이즈를 재현하기는 어려움. 반면, 스테레오 비전을 통한 Disparity 단서는 노이즈 없는 시뮬레이션과 실제 환경 간의 기하학적 전이에 훨씬 더 강건한 모달리티임을 관찰함.
  • 동적 Gap 완화 전략: 준정적(Quasi-static) 가정 하에 단순 위치 제어를 사용하며, 시뮬레이션 내 마찰 계수 등을 무작위하여 강건성을 높임.

3.5 학습 세부사항(Traning Details)

  • 점진적 행동 생성(Progressive Action Generation): GraspVLA방식을 채택하여, 최종 행동 청크를 예측하기 위해 중간 유도 단계로 타켓 객체의 2D 바운딩 박스와 그리퍼의 다음 Key-frame Pose를 먼저 예측하도록 생성 과정을 구성함.
  • 연산 오버헤드 축소: 좌우 뷰에 중복된 의미 정보가 많으므로, 2D 바운딩 박스 예측은 좌측 이미지에 대해서만 수행하도록 요구함.
  • 전체 손실 함수(Total Loss): 5가지 Task의 손실을 합산하여 최적화함.
    L=Laction+Ldepth+Lcamera+Lbbox+Lpose\mathcal{L} = \mathcal{L}_{action} + \mathcal{L}_{depth} + \mathcal{L}_{camera} + \mathcal{L}_{bbox} + \mathcal{L}_{pose}
    • Laction\mathcal{L}_{action}: 행동 청크 예측을 위한 Flow-matching Loss
    • 나머지(Ldepth,Lcamera,Lbbox,Lpose\mathcal{L}_{depth}, \mathcal{L}_{camera}, \mathcal{L}_{bbox}, \mathcal{L}_{pose}): 각각 깊이, 카메라 파라미터, 바운딩 박스, 키프레임 포즈 예측을 위한 크로스 엔트로피 손실
  • 데이터 샘플링 비율 및 학습 환경: 5개 태스크(action, depth, camera, bbox, pose)의 샘플링 비율을 1:2:2:2:1로 맞추어 균형을 잡음. 32개의 NVIDIA H800 GPU에서 batch size 384, Learning Rate 1.6×1041.6 \times 10^{-4}로 총 30만(300K) 스텝 동안 학습을 진행함.

4. Evaluation

  • 본 연구는 실험을 통해 다음 세 가지 질문에 답하고자 함.
    • StereoVLA는 대표적인 조작 작업에서 기존 VLA모델 대비 어느 정도의 성능을 보이는가?
    • 스테레오 카메라 설정은 동등한 학습 조건에서 기존 VLA들의 타 카메라 설정(단일 RGB-D, Wrist View)과 비교했을 때 어떤 이점이 있는가?
    • 제안한 핵심 설계 구성요소(GeoSem, 보조 학습 태스크 등)각각이 전체 성능에 기여하는 바는 무엇인가?

4.1 Real-World Experiments

4.1.1 Task Suite(총 6개의 카테고리)

  • 일반 작업(Common Tasks): 일상 아이템(그릇, 큐브 등)을 사용한 기존 집고 놓기(Pick-and-place) 및 쌓기(Stacking)작업으로, 언어 지시어-모터 스킬 매핑 및 기본 공간 협응 능력을 평가
  • 방해물 작업(Distractor Tasks): 타겟 객체와 외형이 유사한 9개의 무관한 방해물을 복잡하게 배치하여 모델의 Visual Grounding 미 대상 구별 능력을 평가
  • 환경 변화 작업(Environment Tasks): 테이블 배경 텍스처와 조명 조건을 다양하게 변화시켜 실세계 환경 변동에 대한 일반화 능력을 평가
  • 투명 객체 작업(Transparent Object Tasks): 플라스틱 등 투명 재질을 다루며, Depth 센서 기반 모델들이 겪는 광학적 한계와의 차별성을 평가
  • 소형 객체 파지 작업(Small Object Grasping Tasks): 크기 1~2cm의 매우 작은 객체(고추, 사탕 등)을 다루며, 밀리미터 수준의 정밀도와 고해상도 인지-모터 제어 통합능력을 평가
  • 막대형 객체 파지 작업(Bar-shaped Object Grasping Tasks): 포크 등 길이가 길고 폭이 좁은 객체로 평가, 짧은 축은 정밀한 위치 파악이 필요하고 긴 축은 Gripper Occlusion으로 오작동을 유발하기 쉬우며, 카메라 기준 0°, 45°, 90° 방향으로 배치하여 평가함.

4.1.2 Baseline 및 성공 기준(Metrics)

  • 아키텍처 비교 베이스라인: 기존 모델에 Stereo RGB 입력을 적용하도록 개조한 π0.5S\pi_{0.5}-S와 비교한 GraspVLAS-S를 비교함
  • 시스템 설정 비교 베이스라인: 단일 뷰 RGB-D의 대표 모델인 SpatialVLA, 전면+손목 카메라 구성의 π0.5\pi_{0.5}, 전면+측면 구성의 GraspVLA와 비교함.(SpatialVLA의 깊이 품질 영향을 보기 위해 실제 센서 깊이를 쓴 SpatialVLASD-SD, 스테레오 추정 깊이를 쓴 SpatialVLAED-ED도 추가)
  • 엄격한 평가 기준(총 450회 에피소드)
    • 각 시도당 단 한 번의 파지 동작(파지 전 닫기 1회, 후 열기 1회)만 허용하여 반복 재시도로 설공하는 것을 방지
    • OpenVLA 드엥서 사용하는 Gripper sticking 휴리스틱을 비활성화하여 모델의 판단력을 있는 그대로 평가함
    • 부분 점수 없이 완벽히 작업을 마친 경우에만 성공으로 인정함.

4.1.3 주요 실험 결과 및 분석

  • 압도적인 전체 성능 우위: StereoVLA는 모든 평가 태스크에서 베이스라인을 일관되게 상회함.
  • 소형 객체(1~2cm) 파지 결과: 모든 베이스라인이 0%로 완전히 실패한 반면, StereoVLA는 33%의 성공률을 달성함. (224X224 입력 해상도의 한계로 픽셀 수가 적어 33%에 그쳤으나 고해상도 도입 시 추가 개선 가능성 확인)
  • 투명 객체 결과: RGB-D기반 모델들은 Depth센서의 물리적 한계로 6%~40% 성공률에 그쳤으나, StereoVLA는 73%의 높은 성공률을 기록함.
  • Depth 기반 베이스라인 분석: SpatialVLA는 단안 깊이 추정(33%) < 실제 센서 깊이(40%$) > 스테레오 추정 깊이(46%) 순으로 성능이 증가함. 그러나 FoundationStereo로 깊이를 추정해 주입하는 방식은 70ms의 추론 지연 시간이 발생하여 실시간 제어에 부적합함.
  • 정성적 분석: 기존 모델(π0.5\pi_{0.5}, SpatialVLA)은 객체 근처로 이동한 후 정밀 공간 인식이 부족해 그리퍼를 너무 일찍 닫는 실패가 빈번함. GraspVLAS-S는 좌우 뷰를 독립적으로 인코딩하여 막대형 객체는 잘 잡았으나 복잡한 작업에서 붕괴됨. 이는 StereoVLA의 우수성이 단순 데이터나 모달리티 변화가 아닌 설계된 아키텍쳐와 학습 전략의 효과임을 증명함.

4.2 카메라 설정(Camera Setting)

  • 기존 모델들의 원래 설정과 스테레오 설정을 카메라 포즈 변화에 대한 강건성 측면에서 시스템 레벨로 비교함.
    • 실험 조건: 카메라 무작위화 범위를 Small, Medium, Large(구각 및 거리 변화)로 넓히고, 로봇 작동 중 카메라가 좌우로 이동하는 Moving 트랙까지 추가하여 평가(총 180회 에피소드)
    • Stereo RGB(StereoVLA)
      • Small(77.2%), Medium(62.2%), Large(5.9%), Moving(52.2%) 모든 범위에서 가장 높은 성공률을 보이며 시점 변화에 최고의 강건성을 입증함.
    • Front + Side(GraspVLA)
      • Small 범ㅇ뉘에서는 71.7%로 우수하나, 시점 변화가 큰 Large 범위에서는 11.1%, Moving에서는 7.2%로 성능이 급격히 붕괴됨.(두 시점이 크게 틀어질 때 일관된 공간 단서를 결합하지 못함)
    • Front + Wrist(π0.5\pi_{0.5})
      • 손목 카메라가 쥐는 순간의 Ego-centric view를 제공하므로 전역 카메라 시점 변화에 상대적으로 강건함을 유지함.(Large 42.2%), 그러나 정밀 3D 인지 부족으로 그리퍼 조기 닫기 오류로 인해 전체적인 성공률 한계에 부딪힘.
  • 결론": 스테레오 카메라 구성이 작업 성능, 시점 강건성, 배포 단순성(단일 카메라 설치)을 모두 잡는 최적의 대안임을 확인함

4.3 핵심 설계 구성요소 절제 연구(Ablation Study)

  • GraspVLAS-S(스테레오 베이스라인)에 본 논문의 핵심 요소를 하나씩 추가하며 기여도를 분석함.
  • 스테레오 베이스라인(29.0% ~ 10.0%): 단순히 카메라만 스테레오로 바꾼 경우 큰 성능 향상이 없음.
  • +GeoSem 인코더 추가(57.8% ~ 27.1%): 스테레오 기하학 및 의미론적 융합 토큰을 통해 전반적인 작업 성공률이 약 28%p 큰 폭으로 상승함.
  • +상호작용 영역 깊이 추정(DE) 추가(74.9% ~ 30.2%): 로컬 공간 관계에 집중하는 기하학적 보조 학습을 통해 Small 범위에서 17.1%p 추가 향상을 이룸
  • +카메라 파라미터 추정(CPE) 추가(최종 StereoVLA: 77.3% ~ 52.3%)
    • Small 범위에서의 성능 향상은 미미하나, Large(30.2% \rightarrow 54.1%), 및 Moving(27.1% \rightarrow 52.3%)환경에서 억제력이 폭발적으로 상승함.
    • 이는 CPE 태스크가 카메라-로봇 간 기하학적 매핑을 내재화시켜 대폭적인 시점 변화와 흔들림(Moving)에 저항하는 핵심 요소임을 입증함.

4.4 GeoSem 비전 인코더 설계 분석

  • FoundationStereo 특징 선정: 상관 볼륨 VcorrV_{corr}(27.0%) < 원시 코스트 볼륨 VcV_c
    (40.0%) < 필터링된 코스트 볼륨 VcV_c^{'}(51.0%) 순으로 성능이 높음. 필터링 모듈이 제공하는 롱레인지 공간 상관관계가 필수적임을 확인함.
  • 의미적(Semantic) 특징의 필요성: 스테레오 특징 단독 사용(VcV_c^{'}:51.0%) 대비, SigLIP + DINOv2 의미 특징을 결합했을 때 77.0%로 성능이 수직 상승함. (의미 특징 제거 시 엉뚱한 타겟을 잡는 오류 빈발).
  • 특징 융합 방식: 토큰을 시퀀스 방향으로 이어 붙이는 방식은 토큰 길이 2배 증가로 학습 속도가 느리고 성능도 소폭 떨어짐. Channel-wise 연결이 효율성과 정확도 모두 우수함.
  • 파운데이션 모델 비교: 일반 다중 뷰 파운데이션 모델인 VGGT보다 스테레오 특화 모델인 FoundationStereo가 훨씬 정밀한 깊이 정보를 제공함.

4.5 공동 학습(Co-training) 태스크 효과 검증

  • 상호작용 영역 깊이 추정 효과
    • '깊이 예측 안함'이나 '이미지 전체 균일 샘플링 예측' 대비 상호작용 영역 집중 예측이 학습 수렴 속도와 최종 성능에서 모두 최고치를 기록함.
    • 이미지 전체 깊이 예측은 작업과 무관한 배경 학습 부담으로 인해 초기 학습 단계를 오히려 저해함.
  • 카메라 파라미터 추정 효과: 단일 스템 시각 입력만으로도 카메라 이동(Moving)조건에서 높은 안정성을 보이는 것은 학습 시 적용된 시점 무작위화와 CPE 태스크 간의 시너지 결과임.

4.6 Humanoid platform Fine-tuning

  • 양안 시각의 이점 활용: 사람의 시각 시스템과 유사한 휴머노이드 로봇에 적용함
  • 결과: 500개의 합성 데이터로 fine-tuning하여 평가한 결과, 사전 학습(Pre-training)을 거친 모델이 테이블 청소 및 세탁기 문 열기에서 압도적인 우위를 보임
    • 세탁기 작업의 성공률이 낮은 이유는 테이블탑 중심의 사전 학습 데이터 분포와의 도메인 차이때문

4.7 추론 속도 분석(Inference Speed)

업로드중..

  • NVIDIA H800 GPU 기준, FoundationStereo를 끝까지 통과하여 Depth map을 예측하면 68ms가 소요되나, 본 모델처럼 중간 특징인 VcV_c^{'}만 추출하면 14ms로 54ms를 단축함.
  • 전체 시간 분석
    • 비전 인코더: 27ms(FoundationStereo VcV_c^{'} 14ms + SigLIP/DINOv2 13ms)
    • 언어 백본(InternLM-1.8B): 81ms
    • 액션 전문가(Action Expert) 52ms
    • 총 추론 시간: 168ms(약 6Hz 제어 주파수)로, 실시간 로봇 제어에 충분한 효율성을 입증함.

5. Limitation and Future work

  • 두 가지 주요한 한계가 있음
    • 224x224 해상도는 Small Object에 대한 작업 성능을 제한함. 연산 비용과 균형을 맞추면서 더 높은 고해상도를 탐색하는 것이 중요
    • 모델이 Long-horizon의 시간적 의존성을 포착하지 못하여 더 복잡한 다단계 작업을 해결하는 능력이 제한됨.

6. Conclusion

  • Stereo Vision의 기하학적 단서를 활용한 VLA모델인 StereoVLA모델을 제안
  • 실험을 통해 기존 VLA방법들 보다 우수한 성능을 거둠.
profile
Robotics

0개의 댓글