
전통적인 3차원 재구성은 bundle adjustment와 같은 반복적인 최적화 기술을 활용하는 viusal-geometry 방법론으로 접근해왔고, 머신러닝은 feature matching이나 monocular depth estimation 처럼 기하학만으로 해결할 수 없는 작업들을 처리하며 상호보완 역할을 수행했다. 이들의 통합이 긴밀해지면서 VGGSfM과 같은 최신 Structure from Motion 기법들은 미분 가능한 bundle adjustment를 통해 visual-geometry와 머신러닝을 end-to-end로 결합한다. 하지만 visual-geometry는 3차원 재구성에서 중요한 역할을 맡고 있음에도 불구하고, 복잡성과 연산 비용을 증가시킨다는 문제가 있다.
저자는 신경망이 강력해짐에 따라, 신경망만으로 기하학적 후처리 없어 3D task를 해결할 수 있지 않을까 생각한다. 그래서 하나, 소수, 또는 수 백 깨의 view로부터 주요 3D 속성 (카메라 파라미터, point map, depth map, point track)을 추론하는 네트워크인 VGGT를 소개한다. 이 모든 것을 단 한 번의 forward pass를 통해 수 초 안에 수행해내고, DUSt3R, MASt3R, VGGSfM과 같이 유용한 결과를 위해 여전히 계산 비용이 많이 드는 반복적인 최저고하 과정 없이도 뛰어난 성능을 발휘한다.
네트워크의 입력으로는 같은 3차원 공간을 바라보는 개의 연속된 RGB 이미지가 들어가고, 이 네트워크는 각 프레임마다 대응되는 3D annotation 세트로 맵핑해준다.
여기서 는 카메라 파라미터를 rotation quaternion, translation vector, field of view로 파라미터화한 것이고, 는 각각 depth map, point map, point tracking에 사용될 tracking features이다.
이미지 시퀀스 내 이미지 순서는 임의적이지만, 첫 번째 이미지가 참조 프레임으로 선택된다. 네트워크는 첫 번째 프레임을 제외한 모든 프레임에 대해 permutation equivariant 하도록 설계된다.
VGGT가 예측하는 항목들이 모두 독립적이지는 않다. 예를 들어 추론된 point map이 있을 때, 카메라 파라미터를 Perspective-n-Point (PnP) 문제를 풀어서 얻을 수 있을 것이다. Depth map 또한 point map과 카메라 파라미터로부터 도출할 수 있을 것이다. 하지만, 학습과정에서 언급한 모든 양의 데이터를 예측하도록 학습시키면 이 항목들이 닫힌 형태로 묶여있다해도 성능이 크게 향상된다고 한다. 한편 추론 과정에서는 출력된 point map을 바로 사용하는 것보다 출력된 depth map과 카메라 파라미터를 결합하여 사용하는 것이 더 정확한 3D 포인트를 생성한다고 한다.
모델 는 거대한 Transformer 네트워크를 사용하고, 각 입력 이미지는 DINO를 통해 토큰들로 패치화한다. 각 프레임마다 생성된 이미지 토큰들은 alternating frame-wise, global self-attention layer들을 통과한다.

저자는 기존의 Transformer 구조를 Alternating-Attention으로 변경하여 프레임의 local 영역과 global 영역에 교대로 집중하도록 만든다. 구체적으로, frame-wise self-attention은 프레임 내의 토큰에 개별적으로 주의를 기우리고, global self-attention은 모든 프레임에 걸친 전체 토큰에 주의를 기울인다. 저자는 이 두 attention이 교대로 배치된 개의 layer를 사용하고, 어떠한 cross-attention은 사용하지 않는다.
각 이미지 토큰에 하나의 카메라 토큰과 4개의 register 토큰을 결합하여 네트워크에 통과시켜 출력 토큰을 얻는다. 이 때 첫번째 프레임의 카메라 및 register 토큰은 다른 모든 프레임의 토큰들과 구분되는 별도의 학습 가능한 토큰 잡단으로 설정된다. 이 과정을 통해 모든 3D 예측 결과를 첫번째 카메라의 좌표계에 표현할 수 있게 된다. 여기서 출력된 register 토큰은 버려지고, 카메라 토큰과 이미지 토큰만 예측에 사용된다.
카메라 파라미터, point map, depth map은 첫 번째 프레임에 대응하는 카메라 좌표계를 기준으로 예측된다. 이에 따라 첫 번째 카메라의 외부 파라미터는 identity 상태로 설정되어 rotation quaternion은 , translation vector는 이 된다.
카메라 파라미터는 출력된 카메라 토큰을 4개의 self-attention layer와 linear layer에 통과시켜 예측된다.

출력된 이미지 토큰은 dense prediction layer (DPT) 를 통과시켜 feature map으로 변환한 후 convolution layer를 거쳐 depth map과 point map으로 맵핑된다. 추가로 DPT head는 tracking head의 입력으로 쓰일 tracking feature도 출력한다.
DPT layer를 통과해서 얻은 tracking feature는 CoTracker2의 입력으로 사용되고, query 이미지 내의 query 포인트가 주어지면 3D 포인트에 대응하는 2D 포인트 집합을 예측한다.