Title : View-Invariant Policy Learning via Zero-Shot Novel View Synthesis(CoRL 2024)
논문 링크 : https://arxiv.org/pdf/2409.03685
blog: https://s-tian.github.io/projects/vista/

1. Abstract
- 대규모 시각 데이터로부터 학습된 지식을 활용하여 로봇 조작의 시점 변화(Observational Viewpoint) 문제를 해결하는 방법
- 대규모 Visuomotor 정책 학습은 범용적인 로봇 시스템 개발을 위한 유망한 방법이지만, 다양한 하드웨어, 환경 및 시각적 시점 변화에 대응하는 정책을 만드는 것은 여전히 어려운 과제
- 단일 이미지에서 새로운 시점의 이미지를 생성하는 Novel View Synthesis(NVS)모델을 사용하여 3D 인식(3D-aware) 능력을 갖춘 Scene 수준의 사전 지식을 로봇 학습에 주입
- 제안(VISTA): 저자들은 단일 시점의 demo data로부터 시점 불변(Viewpoint-invariant)정책을 학습하기 위해 VISTA(View Synthesis Augmentation) 라는 데이터 증강 기법을 제안하고 이를 분석
- 훈련 시 경험하지 못한 시점에서 Policy를 테스트했을 때, VISTA를 적용한 모델이 시뮬레이션과 실제 로봇 조작 작업 모두에서 기존 baseline 모델보다 우수한 성능을 보임
2. Introduction
-
Learning viewpoint-robust robotic policies
- 데이터 증강 기반 접근(Augmentation-based)
- 시뮬레이터에서 가상 카메라를 사용해 렌더링된 이미지를 추가하거나, 2D 이미지를 Reprojection하여 증강된 데이터를 얻음
- 시뮬레이터 기반 데이터는 실제 환경에 적용할 때 Sim-to-Real Gap 문제가 발생. 본 논문은 이와 달리 실제 로봇 trajectory 데이터를 포함한 배포 환경의 데이터를 직접 사용
- Wrist camera 이미지의 시점을 증강하는 기존 연구도 있었으나, 이는 주로 Covariate shift 완화가 목적이었고 사실적인 Novel View 생성을 위한 Static Scene의 많은 view가 필요하다는 제약이 있음.
- 명시적 3D 표현형 활용(Explicit 3D Representations):
- point clouds나 voxels같은 3D 표현형을 구성하여 Equivariance 성질을 활용하거나, 이를 정규화된 시점의 2D 이미지로 투영하여 처리
- 시점 변화에 매우 Robust하지만, 정밀하게 보정된 카메라 외부 파라미터가 필수적. 이는 실제 데이터 수집 시 번거롭고 시간이 많이 걸리며, Open X-Embodiment같은 대규모 데이터셋 상당수에는 이 정보가 퐇마되지 않음.
- 잠재 표현형 학습(Latent Representation Learning):
- 시점 학습이나 대조 학습(Contrastive learning)을 사전 학습 또는 보조 목표로 사용하여 시점 변화에 강한 잠재 공간을 학습
- 여전히 정확한 외부 파라미터가 필요하거나, 추론 시 계산 비용이 많이 들고, 잠재 공간에 대한 제약 때문에 멀티태스크 학습이 어려워질 수 있음.
-
단일 이미지 Novel View 합성(Single-image Novel View Synthesis)
- 단일 소스 이미지로부터 대상 시점의 이미지를 재구성하는 기술의 흐름.
- 기존 기술: 하나 혹은 소수의 이미지에서 NeRF를 추론하거나, 최근에는 Diffusion Models을 훈련시켜 시점을 합성하고 3D Representation을 추출하는 방식이 연구
- VISTA는 이러한 Scene 합성 기술은 Scene-level로 확장되어 로봇 조작 환경에 적합해졌지만, 로봇 정책 학습에 적용한 사례는 없음
-
로봇 공학에서의 생성형 이미지 모델(Generative Image Models in Robotics)
- 의미론적 증강(Semantic Augmentation): 보지 못한 배경이나 물체에 일반화하기 위해 생성 모델을 사용한 연구들이 있으나, 이는 "카메라 시점"보다 "환경 구성"의 일반화에 초점이 맞춰져 있음.
- 하지만 Gripper 주변의 Local 정보만 제공하므로 3인칭 observation을 완전히 대체할 수 없음.
- 본 연구는 Wrist view와 thrid view 서로 상호 보완적으로 성능을 향상시킬 수 있음을 실험으로 입증
4. Preliminaries

-
Problem Statement
-
본 연구는 주로 Visual Imitation Learning환경에서 문제를 정의
- 수학적 프레임워크: 로봇 조작 문제를 POMDP로 공식화
- 상태 공간 S, 행동 공간 A, 전이 함수 P, 보상 함수 R, 관측 함수 O로 구성됨.
- 관측 함수(O): 상태와 행동을 관측 공간으로 매핑하며, 이때 카메라 외부 파라미터(Extrinsics) E에 의존함.
- 데이터셋(D): M 개의 Expert Demonstration trajectory τ로 구성됨.
- 각 관측값 o는 로봇의 Proprioceptive 정보와 고정된 3인칭 카메라(Eorig)로부터 캡처된 RGB 이미지 oI를 포함함.
- 훈련 목표: 테스트 시점에 카메라 외부 파라미터가 Etest(Eorig와 다른 분포)로 변경되어도 작업을 성공적으로 수행하는 정책 π(a∣o)를 학습하는 것이 목표
- 핵심 제약: 훈련 중에 환경에 직접 접근하거나 추가 센서를 배치할 수 없다고 가정. 즉, 이미 수집된 오프라인 데이터만 활용해야함.
-
단일 이미지로부터 제로샷 Novel View 합성(Zero-shot NVS from a Single Image)
-
VISTA의 핵심 도구인 Novel view Synthesis(NVS) 모델 M 에 대한 정의
- 함수 정의: 모델 M(Icontext,f,Econtext,Etarget)은 다음 입력을 받음.
- Icontext: 소스 시점의 입력 이미지
- f: 카메라 시야각(Field of View)을 포함한 간소화된 내부 파라미터(Intrinsics)
- Econtext: 소스 카메라의 외부 파라미터(포즈)
- Etarget: 생성하고자 하는 대상 카메라의 외부 파라미터
- 출력: 동일한 Scene을 대상 시점(Etarget)에서 바라본 이미지 (Itarget)을 rendering
- Zero-shot의 정의: 여기서 말하는 Zero-shot은 모델 M이 훈련 시 본적 없는 새로운 로봇 task 이미지에 대해서도 시점 합성을 수행할 수 있어야 함.
-
시점 분포의 설정(Evaluation Viewpoint Ranges)
- 논문은 시전 변화의 난이도를 두 가지 수준으로 정의하여 평가
- Perturbation(섭동)
- 소스 시점에서 미세한 평행 이동(Δt)과 회전(Δr)이 발생한 분포
- 카메라가 시간이 지남에 따라 미세하게 흐르거나 물리적 충격으로 위치가 약간 변한 경우
- Quarter Circle Arc(사분원 호)
- 로봇 베이스를 중심으로 반경을 유지하며 최대 90' 방위각 내에서 샘플링된 분포
- 로봇 주위의 와전히 다른 위치에 새로운 카메라를 설치한 것과 유사한 큰 시점 변화
5. Learning View Invariance with Zero-Shot Novel View Synthesis Models

5.1 VISTA의 핵심 작동 기제
- VISTA는 수집된 전문가 데모의 각 프레임을 NVS 모델을 통해 생성된 가상 시점 이미지로 대체하는 방식
- 데이터 대체 과정: 원본 데이터셋의 observation-action pair (o,a)를 (M(oI,f,Econtext,Etarget),a)로 변환
- 이때 행동(Action, a)은 고정한 채 관측 이미지 oI만 새로운 시점 (Etarget)으로 렌더링하여 교체
- 시점 샘플링: Target 시점 Etarget은 훈련 시 미리 정의된 시점 분포 Etrain 에서 독립적으로 무작위 샘플링됨.
- 상대 포즈 활용: 시뮬레이션 실험에서는 정확한 포즈 정보를 사용하지만, 실제 모델 구동 시에는 소스(Econtext)와 타겟(Econtext)사이의 상대적인 포즈 변화량만 있으면 충분함. 절대적인 포즈 값은 필수가 아님.
5.2 사용 모델: ZeroNVS
-VISTA성능을 극대화하기 위해 선택된 핵심 모델은 ZeroNVS임.
- 모델 특성: Stable Diffusion을 기반으로 하며, 다양한 3D Scene 모음으로 Fine tune된 latent Diffusion Model임.
- 장점: Zero-host 성능이 뛰어나며 생성된 이미지가 선명하고 사실적임. 이는 생성된 이미지와 실제 이미지 사이의 Domain gap을 줄이는데 도움이 됨.
- 실패 사례 필터링(LPIPS 기반): ZeroNVS가 가끔 Scene을 과도하게 확대하는 등 비정상적인 이미지를 생성하는 경우를 대비하여, 원본 이미지와 생성 이미지 사이의 지각적 유사도(LPIPS)를 측정, 유사도 거리가 임계값(η)보다 크면 해당 이미지를 reject하고 Re-sampling
5.3 VISTA의 주요 속성
- 3D 재구성 비용 절감: Multi-view 이미지나 static scene을 가정한 복잡한 3D 재구성(sfM 등) 과정을 거치지 않고, 특정 시점의 단일 프레임에서 즉시 시점을 생성함.
- 추론 오버헤드 제로: 데이터 증강은 오직 학습 단계에서만 이루어짐. 따라서 실제 로봇에 배포된 정책의 추론 속도(Forward pass)는 전혀 느려지지 않음.
- 발전 가능성: NVS 모델 자체의 모델링 능력과 일반화 성능이 향상됨에 따라 VISTA의 성능도 자연스럽게 향상하는 구조
5.4 구현 베이스라인
- 시뮬레이션: robomimic 프레임워크를 사용하며, Behavior Cloning(BC)에 Gaussian Mixture Model(GMM)을 결합하여 출력
- 실제 로봇: 실제 환경에서의 성공적인 정책 학습을 위해 Diffusion Policy를 훈련 모델로 채택
6. Experimental Analysis
6.1 실험 환경 및 비교 대상(Baselines)


- Q2: 로봇 데이터 미세 조정의 효과
- 로봇 도메인 데이터로 NVS 모델을 Fine tune하면 더 큰 시점 변화(90° 회전)에 대응할 수 있는가?
- 테스트 시점: 훨씬 난이도가 높은 Quarter Circle Arc(사분원 호) 분포에서 평가함.
- 결과:
- 단순 Reprojection 방식은 카메라 시야를 벗어나는 영역 때문에 성능 향상이 제한적
- ZeroNVS(Mimicgen): 시뮬레이션 로봇 데이터로 미세 조정한 모델은 화질이 훨씬 개선됨. 성공률이 베이스라인 대비 최대 2배 이상 향상되었음.
- 이는 훈련 시 보지 못한 물체(Unseen Object)나 다른 로봇(X-Embodiment)환경에서도 유효함.

- Q3: 손목 카메라와의 상호작용
- 3인칭 View Augmentation과 Wrist view 활용은 어떤 관계인가?
- 결과:
- Wrist View는 시점 변화에 무관한 정보를 제공하므로 전체적인 성공률을 높여줌.
- 중요한 점은 VISTA(3인칭 뷰 증강)와 손목 카메라를 동시에 사용했을 때 가장 높은 성능을 보임.
- 즉, 두 전략을 서로 경쟁하는 것이 아니라 상호 보완적임.

- Q4: 실제 로봇 적용 결과
- 실제 세계의 대규모 데이터로 학습된 NVS모델이 실제 로봇 정책에 도움이 되는가?
- Franka로봇으로 '컵을 받침대에 놓기'작업을 수행하며, 4개의 새로운 테스트 시점(Camera 2~5)에서 평가하였음.
- NVS 학습: 75000개의 실제 로봇 궤적이 포함된 DROID 데이터셋 중 일부로 ZeroNVS를 Fine tune하였음.
- 결과:
- ZeroNVS(DROID) 모델로 증강했을 때, 원본 데이터만 사용한 모델보다 훨씬 높은 Viewpoint 견고성을 보임.
- 특히 원본 시점에서 멀어질수록 일반 모델은 동작이 무작위로 변하는 반면, VISTA 적용 모델은 성공적으로 컵을 집으로 이동.

7. Conclusion & Limitations
- Limitations:
- 계산 비용: 새로운 시점을 생성하는 과정이 오프라인 전처리 단계에서 10~20시간 정도 소요
- 샘플링 분포 의존성: 테스트 시 발생할 수 있는 시점 범위를 어느 정도 예측하여 증강 분포를 설정
- 극단적 시점 변화: 원본 카메라와 각도가 너무 크게 차이 나면 합성된 이미지의 품질이 저하되어 정책 학습에 방해가 될 수 있음.
- Conclusion:
- VISTA는 추가적인 센서나 수작업 없이도 생성 모델의 3D 사전 지식만을 이용해 로봇 시점 불변성을 획기적으로 개선할 수 있는 단순하고 강력한 방법임을 입증.