[논문 리뷰] View-Invariant Policy Learning via Zero-Shot Novel View Synthesis

두부김치·2026년 4월 15일

논문 리뷰

목록 보기
15/26

Title : View-Invariant Policy Learning via Zero-Shot Novel View Synthesis(CoRL 2024)
논문 링크 : https://arxiv.org/pdf/2409.03685
blog: https://s-tian.github.io/projects/vista/

1. Abstract

  • 대규모 시각 데이터로부터 학습된 지식을 활용하여 로봇 조작의 시점 변화(Observational Viewpoint) 문제를 해결하는 방법
  • 대규모 Visuomotor 정책 학습은 범용적인 로봇 시스템 개발을 위한 유망한 방법이지만, 다양한 하드웨어, 환경 및 시각적 시점 변화에 대응하는 정책을 만드는 것은 여전히 어려운 과제
  • 단일 이미지에서 새로운 시점의 이미지를 생성하는 Novel View Synthesis(NVS)모델을 사용하여 3D 인식(3D-aware) 능력을 갖춘 Scene 수준의 사전 지식을 로봇 학습에 주입
  • 제안(VISTA): 저자들은 단일 시점의 demo data로부터 시점 불변(Viewpoint-invariant)정책을 학습하기 위해 VISTA(View Synthesis Augmentation) 라는 데이터 증강 기법을 제안하고 이를 분석
  • 훈련 시 경험하지 못한 시점에서 Policy를 테스트했을 때, VISTA를 적용한 모델이 시뮬레이션과 실제 로봇 조작 작업 모두에서 기존 baseline 모델보다 우수한 성능을 보임

2. Introduction

  • 로봇 파운데이션 모델의 도전 과제

    • 로봇 조작을 위한 파운데이션 모델은 수많은 작업과 환경, 그리고 다양한 Embodiment에 걸쳐 일반화되어야 함.
    • 특히 각 로봇마다 고유한 센서 구성과 인식 파이프라인을 가지고 있다는 점이 현재 시스템의 큰 도전 과제
    • 데이터 규모를 확장하기 위해 상대적으로 구하기 쉬운 3인칭 RGB Image를 Common modality로 사용하는 접근법이 주목받고 있음
  • Viewpoint Shift에 따른 성능 저하

    • 현재의 방법론으로 학습된 정책은 단일 RGB이미지에서 발생하는 Perceptual shifts에 대응하는 어려움을 겪음
    • 가장 흔하면서도 까다로운 변화는 카메라 변화(Viewpoint)이 바뀌는 경우
    • 기존의 연구에 따르면, 고정된 시점에서 수집된 RGB이미지로 학습된 Policy는 카메라의 위치나 각도가 조금만 달라져서 일반화에 실패하는 경향을 보임
  • 기존 해결책의 한계

    • 시점 불변성(Viewpoint invariance)을 학습하기 위한 기존 방식들은 다음과 같은 단점이 있음
      • 시뮬레이션 데이터 증강: 실제 환경에 적용할 때 Sim-to-Real Gap 문제를 해결해야 함.
      • 실제 데이터 수집 시 카메라 위치 변경: 대규모 데이터 수집 시 엄청난 수작업과 노력이 필요함.
  • 제안 방법: VISTA(View Synthesis Augmentation)

    • 본 논문은 대규모 시각 데이터를 통해 학습된 생성형 모델의 3D 사전 지식(3D priors)을 활용하여 정책의 견고성을 높이는 방안을 제시
    • 학습 과정 중에 3D 인식 이미지 확산 기반 NVS(Novel View Synthesis)모델로부터 새로운 시점의 이미지들을 샘플링하여 데이터를 증강
    • 이 방식을 통해 Policy은 훈련 데이터의 분포를 벗어난(Out-of-distribution, OOD) 시점의 이미지에 대해서도 robust해짐
  • VISTA의 주요 이점

    • 데이터 다양성: 명시적인 3D 관측값이 없는 기존의 방대한 로봇 상호작용 데이터셋을 활용할 수 있음.
    • 도메인 내 로봇 데이터가 있다면 미세 조정을 통해 성능을 더 높일 수 있음.
    • 깊이 정보나 카메라 정보(Extrinsics)이 필수적이지 않음
    • 정책의 형태에 제한이 없으면, Inference시 동작을 변경하지 않으므로 실행 속도에 영향을 주지 않음.

3. Related Work

  • Learning viewpoint-robust robotic policies

    • 데이터 증강 기반 접근(Augmentation-based)
      • 시뮬레이터에서 가상 카메라를 사용해 렌더링된 이미지를 추가하거나, 2D 이미지를 Reprojection하여 증강된 데이터를 얻음
      • 시뮬레이터 기반 데이터는 실제 환경에 적용할 때 Sim-to-Real Gap 문제가 발생. 본 논문은 이와 달리 실제 로봇 trajectory 데이터를 포함한 배포 환경의 데이터를 직접 사용
      • Wrist camera 이미지의 시점을 증강하는 기존 연구도 있었으나, 이는 주로 Covariate shift 완화가 목적이었고 사실적인 Novel View 생성을 위한 Static Scene의 많은 view가 필요하다는 제약이 있음.
    • 명시적 3D 표현형 활용(Explicit 3D Representations):
      • point clouds나 voxels같은 3D 표현형을 구성하여 Equivariance 성질을 활용하거나, 이를 정규화된 시점의 2D 이미지로 투영하여 처리
      • 시점 변화에 매우 Robust하지만, 정밀하게 보정된 카메라 외부 파라미터가 필수적. 이는 실제 데이터 수집 시 번거롭고 시간이 많이 걸리며, Open X-Embodiment같은 대규모 데이터셋 상당수에는 이 정보가 퐇마되지 않음.
    • 잠재 표현형 학습(Latent Representation Learning):
      • 시점 학습이나 대조 학습(Contrastive learning)을 사전 학습 또는 보조 목표로 사용하여 시점 변화에 강한 잠재 공간을 학습
      • 여전히 정확한 외부 파라미터가 필요하거나, 추론 시 계산 비용이 많이 들고, 잠재 공간에 대한 제약 때문에 멀티태스크 학습이 어려워질 수 있음.
  • 단일 이미지 Novel View 합성(Single-image Novel View Synthesis)

    • 단일 소스 이미지로부터 대상 시점의 이미지를 재구성하는 기술의 흐름.
    • 기존 기술: 하나 혹은 소수의 이미지에서 NeRF를 추론하거나, 최근에는 Diffusion Models을 훈련시켜 시점을 합성하고 3D Representation을 추출하는 방식이 연구
    • VISTA는 이러한 Scene 합성 기술은 Scene-level로 확장되어 로봇 조작 환경에 적합해졌지만, 로봇 정책 학습에 적용한 사례는 없음
  • 로봇 공학에서의 생성형 이미지 모델(Generative Image Models in Robotics)

    • 의미론적 증강(Semantic Augmentation): 보지 못한 배경이나 물체에 일반화하기 위해 생성 모델을 사용한 연구들이 있으나, 이는 "카메라 시점"보다 "환경 구성"의 일반화에 초점이 맞춰져 있음.
    • 하지만 Gripper 주변의 Local 정보만 제공하므로 3인칭 observation을 완전히 대체할 수 없음.
    • 본 연구는 Wrist view와 thrid view 서로 상호 보완적으로 성능을 향상시킬 수 있음을 실험으로 입증

4. Preliminaries

  • Problem Statement

  • 본 연구는 주로 Visual Imitation Learning환경에서 문제를 정의

    • 수학적 프레임워크: 로봇 조작 문제를 POMDP로 공식화
      • 상태 공간 SS, 행동 공간 AA, 전이 함수 PP, 보상 함수 RR, 관측 함수 OO로 구성됨.
      • 관측 함수(OO): 상태와 행동을 관측 공간으로 매핑하며, 이때 카메라 외부 파라미터(Extrinsics) EE에 의존함.
    • 데이터셋(DD): MM 개의 Expert Demonstration trajectory τ\tau로 구성됨.
      • 각 관측값 oo는 로봇의 Proprioceptive 정보와 고정된 3인칭 카메라(EorigE_{orig})로부터 캡처된 RGB 이미지 oIo_I를 포함함.
    • 훈련 목표: 테스트 시점에 카메라 외부 파라미터가 EtestE_{test}(EorigE_{orig}와 다른 분포)로 변경되어도 작업을 성공적으로 수행하는 정책 π(ao)\pi(a|o)를 학습하는 것이 목표
    • 핵심 제약: 훈련 중에 환경에 직접 접근하거나 추가 센서를 배치할 수 없다고 가정. 즉, 이미 수집된 오프라인 데이터만 활용해야함.
  • 단일 이미지로부터 제로샷 Novel View 합성(Zero-shot NVS from a Single Image)

  • VISTA의 핵심 도구인 Novel view Synthesis(NVS) 모델 MM 에 대한 정의

    • 함수 정의: 모델 M(Icontext,f,Econtext,Etarget)M(I_{context}, f, E_{context}, E_{target})은 다음 입력을 받음.
      • IcontextI_{context}: 소스 시점의 입력 이미지
      • ff: 카메라 시야각(Field of View)을 포함한 간소화된 내부 파라미터(Intrinsics)
      • EcontextE_{context}: 소스 카메라의 외부 파라미터(포즈)
      • EtargetE_{target}: 생성하고자 하는 대상 카메라의 외부 파라미터
    • 출력: 동일한 Scene을 대상 시점(EtargetE_{target})에서 바라본 이미지 (ItargetI_{target})을 rendering
    • Zero-shot의 정의: 여기서 말하는 Zero-shot은 모델 MM이 훈련 시 본적 없는 새로운 로봇 task 이미지에 대해서도 시점 합성을 수행할 수 있어야 함.
  • 시점 분포의 설정(Evaluation Viewpoint Ranges)

    • 논문은 시전 변화의 난이도를 두 가지 수준으로 정의하여 평가
    • Perturbation(섭동)
      • 소스 시점에서 미세한 평행 이동(Δt\Delta t)과 회전(Δr\Delta r)이 발생한 분포
      • 카메라가 시간이 지남에 따라 미세하게 흐르거나 물리적 충격으로 위치가 약간 변한 경우
    • Quarter Circle Arc(사분원 호)
      • 로봇 베이스를 중심으로 반경을 유지하며 최대 90' 방위각 내에서 샘플링된 분포
      • 로봇 주위의 와전히 다른 위치에 새로운 카메라를 설치한 것과 유사한 큰 시점 변화

5. Learning View Invariance with Zero-Shot Novel View Synthesis Models

5.1 VISTA의 핵심 작동 기제

  • VISTA는 수집된 전문가 데모의 각 프레임을 NVS 모델을 통해 생성된 가상 시점 이미지로 대체하는 방식
    • 데이터 대체 과정: 원본 데이터셋의 observation-action pair (o,ao,a)를 (M(oI,f,Econtext,Etarget),a)(\mathcal{M}(o_{I}, f, E_{context}, E_{target}), a)로 변환
      • 이때 행동(Action, aa)은 고정한 채 관측 이미지 oIo_I만 새로운 시점 (EtargetE_{target})으로 렌더링하여 교체
    • 시점 샘플링: Target 시점 EtargetE_{target}은 훈련 시 미리 정의된 시점 분포 Etrain\mathcal{E}_{train} 에서 독립적으로 무작위 샘플링됨.
    • 상대 포즈 활용: 시뮬레이션 실험에서는 정확한 포즈 정보를 사용하지만, 실제 모델 구동 시에는 소스(EcontextE_{context})와 타겟(EcontextE_{context})사이의 상대적인 포즈 변화량만 있으면 충분함. 절대적인 포즈 값은 필수가 아님.

5.2 사용 모델: ZeroNVS

-VISTA성능을 극대화하기 위해 선택된 핵심 모델은 ZeroNVS임.

  • 모델 특성: Stable Diffusion을 기반으로 하며, 다양한 3D Scene 모음으로 Fine tune된 latent Diffusion Model임.
  • 장점: Zero-host 성능이 뛰어나며 생성된 이미지가 선명하고 사실적임. 이는 생성된 이미지와 실제 이미지 사이의 Domain gap을 줄이는데 도움이 됨.
  • 실패 사례 필터링(LPIPS 기반): ZeroNVS가 가끔 Scene을 과도하게 확대하는 등 비정상적인 이미지를 생성하는 경우를 대비하여, 원본 이미지와 생성 이미지 사이의 지각적 유사도(LPIPS)를 측정, 유사도 거리가 임계값(η\eta)보다 크면 해당 이미지를 reject하고 Re-sampling

5.3 VISTA의 주요 속성

  • 3D 재구성 비용 절감: Multi-view 이미지나 static scene을 가정한 복잡한 3D 재구성(sfM 등) 과정을 거치지 않고, 특정 시점의 단일 프레임에서 즉시 시점을 생성함.
  • 추론 오버헤드 제로: 데이터 증강은 오직 학습 단계에서만 이루어짐. 따라서 실제 로봇에 배포된 정책의 추론 속도(Forward pass)는 전혀 느려지지 않음.
  • 발전 가능성: NVS 모델 자체의 모델링 능력과 일반화 성능이 향상됨에 따라 VISTA의 성능도 자연스럽게 향상하는 구조

5.4 구현 베이스라인

  • 시뮬레이션: robomimic 프레임워크를 사용하며, Behavior Cloning(BC)에 Gaussian Mixture Model(GMM)을 결합하여 출력
  • 실제 로봇: 실제 환경에서의 성공적인 정책 학습을 위해 Diffusion Policy를 훈련 모델로 채택

6. Experimental Analysis

6.1 실험 환경 및 비교 대상(Baselines)

  • 시뮬레이션: MuJoCo 기반의 robomimic 및 MimicGen 프레임워크를 사용.

  • 비교 모델(Baselines):

    • Single View: 증강 없이 원본 시점 데이터로만 학습한 모델
    • Simulator (oracle): 시뮬레이터에서 직접 가상 카메라로 렌더링한 데이터를 사용하는 성능 상한선(Upper bound)
    • Depth estimation + Reprojection: ZoeDepth로 깊이를 추정하고 Reprojection한 뒤 Stable Diffusion으로 인페이팅하는 3단계 파이프라인
    • PixelNeRF: ZeroNVS대신 PixelNeRF 모델을 사용하여 시점을 생성하는 방식
  • Q1: 사전 학습된 NVS 모델의 성능

    • 대규모 데이터로 학습된 NVS 모델이 로봇 정책의 견고성을 높일 수 있는가?
    • 테스트 시점: 카메라가 미세하게 흔들리는 정도의 Perturbation(섭동)분포에서 평가.
    • 결과:
      • Single View 모델은 시점이 조금만 바뀌어도 성능이 급락함.
      • PixelNeRF는 생성 화질이 낮아 오히려 성능을 떨어뜨리는 결과를 보임.
      • ZeroNVS는 로봇 데이터를 본 적이 없음에도 불구하고, 모든 작업(Lift, Threading, Nut Asm)에서 Single view 및 Reprojection 방식보다 우수한 성공률을 보임.


  • Q2: 로봇 데이터 미세 조정의 효과
    • 로봇 도메인 데이터로 NVS 모델을 Fine tune하면 더 큰 시점 변화(90° 회전)에 대응할 수 있는가?
    • 테스트 시점: 훨씬 난이도가 높은 Quarter Circle Arc(사분원 호) 분포에서 평가함.
    • 결과:
      • 단순 Reprojection 방식은 카메라 시야를 벗어나는 영역 때문에 성능 향상이 제한적
      • ZeroNVS(Mimicgen): 시뮬레이션 로봇 데이터로 미세 조정한 모델은 화질이 훨씬 개선됨. 성공률이 베이스라인 대비 최대 2배 이상 향상되었음.
      • 이는 훈련 시 보지 못한 물체(Unseen Object)나 다른 로봇(X-Embodiment)환경에서도 유효함.

  • Q3: 손목 카메라와의 상호작용
    • 3인칭 View Augmentation과 Wrist view 활용은 어떤 관계인가?
    • 결과:
      • Wrist View는 시점 변화에 무관한 정보를 제공하므로 전체적인 성공률을 높여줌.
      • 중요한 점은 VISTA(3인칭 뷰 증강)와 손목 카메라를 동시에 사용했을 때 가장 높은 성능을 보임.
      • 즉, 두 전략을 서로 경쟁하는 것이 아니라 상호 보완적임.
  • Q4: 실제 로봇 적용 결과
    • 실제 세계의 대규모 데이터로 학습된 NVS모델이 실제 로봇 정책에 도움이 되는가?
    • Franka로봇으로 '컵을 받침대에 놓기'작업을 수행하며, 4개의 새로운 테스트 시점(Camera 2~5)에서 평가하였음.
    • NVS 학습: 75000개의 실제 로봇 궤적이 포함된 DROID 데이터셋 중 일부로 ZeroNVS를 Fine tune하였음.
    • 결과:
      • ZeroNVS(DROID) 모델로 증강했을 때, 원본 데이터만 사용한 모델보다 훨씬 높은 Viewpoint 견고성을 보임.
      • 특히 원본 시점에서 멀어질수록 일반 모델은 동작이 무작위로 변하는 반면, VISTA 적용 모델은 성공적으로 컵을 집으로 이동.

7. Conclusion & Limitations

  • Limitations:
    • 계산 비용: 새로운 시점을 생성하는 과정이 오프라인 전처리 단계에서 10~20시간 정도 소요
    • 샘플링 분포 의존성: 테스트 시 발생할 수 있는 시점 범위를 어느 정도 예측하여 증강 분포를 설정
    • 극단적 시점 변화: 원본 카메라와 각도가 너무 크게 차이 나면 합성된 이미지의 품질이 저하되어 정책 학습에 방해가 될 수 있음.
  • Conclusion:
    • VISTA는 추가적인 센서나 수작업 없이도 생성 모델의 3D 사전 지식만을 이용해 로봇 시점 불변성을 획기적으로 개선할 수 있는 단순하고 강력한 방법임을 입증.
profile
Robotics

0개의 댓글