[논문 정리] DINOv3

blue·2025년 8월 30일

https://arxiv.org/abs/2508.10104


1. Introduction

Foundation Models and SSL

  • Foundation Model: 단일 모델로 다양한 작업·도메인에 일반화 가능한 핵심 구성 요소
  • Self-Supervised Learning (SSL): 레이블 없는 대규모 이미지 데이터로 학습 가능, 무제한에 가까운 원시 데이터 활용 가능
  • DINOv2 사례: 이미지 이해, 조직병리학 등 복잡한 도메인에서 강력한 성능, 입력 분포 변화에 강인한 전역/지역 Feature 제공
  • SSL은 메타데이터가 부족한 도메인(생물학, 의료 영상, 원격 탐사 등)에 적합하며 인간 개입 없는 평생 학습 가능

Challenges in Scaling SSL

  1. Data curation: 레이블 없는 데이터에서 유용한 데이터 선택 방법 불명확
  2. Optimization horizon: 코사인 스케줄은 사전에 학습 기간을 알아야 함
  3. Feature degradation: ViT-Large 이상에서 긴 학습 시 Dense Feature maps 성능 저하

셋 중 3번이 제일 흥미로움. Classification 성능은 계속 오르는데 Dense feature만 망가진다는 건, '모델이 커지면 다 좋아진다'는 통념과 어긋나는 지점.

DINOv3가 이 문제들을 해결해 SSL을 대규모로 확장

Objectives of DINOv3

  1. Versatile Foundational Models: Fine-tuning 없이 다양한 도메인·작업에 최첨단 성능. 예: 고해상도 항공 이미지 PCA로 도로/집/녹지 구분 (Fig. 1(d))

  2. Improved Dense Features: Gram anchoring 기법으로 대규모·장기 학습에서의 Dense Feature 붕괴 해결, DINOv2보다 고해상도에서도 더 깨끗한 Feature maps (Fig. 3)

  3. DINOv3 Model Family: 70억 Parameter 모델을 ViT-S/B/L, ConvNeXt로 Distillation. COCO detection mAP 66.1, ADE20k mIoU 63.0 등 경쟁 모델 능가 (Fig. 2)

Key Contributions

  1. Data Scaling: 자동 curation된 170억 웹 이미지 + ImageNet-1k 등 특화 데이터 혼합
  2. Model Architecture and Training: 70억 Parameter 맞춤 ViT, 축형 RoPE, 위치 아티팩트 방지 정규화. 다중 코사인 스케줄 대신 100만 반복 고정 Hyperparameter 스케줄
  3. Gram Anchoring: Feature maps 노이즈 제거 단계 도입, Dense prediction 성능 대폭 향상
  4. Distillation: Single-teacher multi-student 기법으로 7B 지식을 소형 모델에 전달, Dense tasks 신기록·위성 영상 등에서 우수

  • SSL 발전 흐름: Relative patch position 예측 등 초기 방식 → Inpainting 기반(MAE, JEPA) → Discriminative 기반(iBOT 등, 본 연구와 밀접)
  • Vision Foundation Models: ImageNet 지도학습 → JFT 등 대규모 데이터로 스케일링(ViT, ViT-22B) → CLIP/ALIGN 등 Weakly-supervised → DINOv2가 SSL로 CLIP과 동등/우수한 성능 최초 입증
  • Dense Transformer Features: Local SSL loss, Register tokens, Agglomerative distillation(AM-RADIO, PEspatial) 등으로 Dense Feature 개선 시도. 본 연구는 Gram objective로 Student-Teacher Patch 간 코사인 유사도 규제

Gram anchoring의 핵심 아이디어(코사인 유사도로 patch 관계 규제) 자체는 새롭다기보다, Agglomerative distillation 계열의 방식을 SSL 학습 중간 자기 자신에게 적용한 것으로 보임. 응용 위치가 다른 게 포인트인 듯.


3. Training at Scale Without Supervision

3.1. Data Preparation

  • Instagram 공개 포스트에서 수집한 약 170억 이미지 풀 활용, 콘텐츠 조정 거침

  • 세 가지 데이터셋 구성

    1. Hierarchical k-means 자동 Curation: DINOv2 embedding 기반 5단계 클러스터링 → LVD-1689M(16.89억 이미지)
    2. Retrieval-based curation: 다운스트림 관련 시각 개념 커버
    3. Raw public datasets: ImageNet1k/22k, Mapillary 등
  • Batch sampling: Homogeneous(단일 소스, 예 ImageNet-1k 10%) + Heterogeneous(다양한 소스 혼합) 배치 혼용

  • 결론: 단일 curation 기법만으로는 모든 벤치마크 최적 아님, 전체 파이프라인이 최선 (Tab. 1)

3.2. Large-Scale Training with Self-Supervision

  • DINOv2: 11억 Parameter로 CLIP과 동등 성능 달성했지만, 70억으로 확장 시 Dense prediction 성능 저하
  • DINOv3 목표: Global·Local property 모두 개선

Learning Objective

  • LDINOL_{DINO}(이미지 레벨) + LiBOTL_{iBOT}(Patch-level latent reconstruction)
  • Sinkhorn-Knopp Centering으로 DINO의 기존 centering 대체
  • 각 objective에 전용 Head, 전용 Layer Normalization(kNN +0.2%, ADE20k +1 mIoU, NYUv2 -0.02 RMSE)
  • LDKoleoL_{DKoleo}: Koleo 개선 형태, 소규모 배치 분산 학습으로 구현
LPre=LDINO+LiBOT+0.1LDKoleoL_{Pre} = L_{DINO} + L_{iBOT} + 0.1 \cdot L_{DKoleo}

(참고, DINOv2: Ltotal=LDINO+LiBOT+wkoleoLkoleoL_{total} = L_{DINO} + L_{iBOT} + w_{koleo} \cdot L_{koleo} — DINOv3는 고정 가중치 0.1로 단순화)

Architecture

  • 70억 Parameter (Tab. 2)

  • 맞춤 RoPE: 각 Patch에 [-1,1] 정규화 좌표 부여, Multi-head Attention에서 상대적 위치 정보를 Bias로 추가

  • RoPE-box jittering: 좌표 박스를 -s,s로 무작위 스케일링해 다양한 해상도/종횡비 적응력 강화

Optimization

  • 모든 Parameter 스케줄링 제거 → 고정 LR/Weight decay/Teacher EMA momentum, 다운스트림 성능 개선되는 한 학습 지속 가능
  • AdamW, 배치 크기 4096, 256 GPU

코사인 스케줄을 버리고 상수 스케줄로 간 것도 결국 "학습을 얼마나 오래 할지 미리 정하지 않아도 되게 만들자"는 실용적인 선택으로 보여짐. 대신 그 대가로 뒤에 나오는 Gram anchoring 같은 '사후 보정'이 필요해진 거고, 이 둘이 세트로 묶여 있다는 게 이 논문 구조의 재미있는 부분.

Multi-crop: 이미지당 Global crop 2개(256px) + Local crop 8개(112px), 배치당 총 370만 토큰


4. Gram Anchoring

4.1. Loss of Patch-Level Consistency

  • 장기 학습 시 Classification 성능은 계속 개선되지만 Segmentation(Dense task) 성능은 약 200k 반복 후 저하, ViT-7B는 초기 수준 이하로 하락 (Fig. 5b, 5c)

  • Patch 간 코사인 유사도 시각화로 확인 (Fig. 6): 200k 반복엔 매끄러운 유사도 맵, 600k 이후 품질 저하 및 CLS-Patch 유사도 증가(지역성 감소) 관찰

"패치가 CLS token을 점점 닮아간다"는 표현이 핵심. 전체 이미지 요약에 능숙해지는 대신 각 패치는 고유 위치 정보를 잃는 것으로, 국소적 디테일과 전역적 요약이 trade-off 관계에 있음을 보여주는 실험인 듯.

4.2. Gram Anchoring Objective

  • 핵심 아이디어: 초기 고품질 상태의 Teacher Gram matrix를 기준으로 Student의 Patch 간 관계를 안정화
LGram=XSXSXGXGFL_{Gram} = \| X_S X_S^\top - X_G X_G^\top \|_F

(XSX_S: Student Patch Feature, XGX_G: 초기 고품질 Teacher Patch Feature)

  • Global crop에만 적용, 100만 반복 이후 도입, Gram teacher는 10k 반복마다 EMA teacher와 동일하게 갱신
LRef=wDLDINO+LiBOT+wDLKoleo+wGramLGramL_{Ref} = w_D \cdot L_{DINO} + L_{iBOT} + w_D \cdot L_{Koleo} + w_{Gram} \cdot L_{Gram}
  • 적용 후 iBOT loss 급감, Gram anchoring 도입 10k 반복 내 VOC·ADE20k mIoU 급격히 회복 (Fig. 7, 8)


10k 반복 만에 급격히 회복된다는 게 제일 눈에 띄는 결과. 처음부터 재학습할 필요 없이 초기 시점의 '좋았던 자기 자신'을 기준점 삼아 잡아주는 것만으로 충분하다는 게 실용적으로 보임.

4.3. Leveraging Higher-Resolution Features

  • Gram teacher에 2배 해상도 이미지 입력 → Feature를 Bicubic downsampling → 더 정밀한 Patch 일관성 확보 (Fig. 9a)

  • LHRefL_{HRef}: 고해상도 다운샘플 Gram matrix 기준 → ADE20k +2 mIoU 추가 개선

  • 초기 학습(100k~200k) 시점 Gram teacher가 최적, 100만 시점 teacher는 오히려 성능 저하



5. Post-Training

5.1. Resolution Scaling

  • 초기 256 해상도 학습 → 이후 혼합 해상도(Mixed resolutions, Global 512/768, Local 112~336)로 10k 반복 추가 학습

  • 7B teacher를 Gram teacher로 사용해 고해상도 Dense 성능 저하 방지

  • 결과: 최대 768 넘어 4K 이상에서도 안정적인 Feature maps (Fig. 11)

5.2. Model Distillation

  • ViT-7B → ViT-S(21M)/S+(29M)/B(86M)/L(0.3B)/H+(0.8B) 로 Distillation (Tab. 14)

  • Parallel distillation pipeline: 다중 Student를 동시 학습하며 모든 노드에서 Teacher 추론 결과 공유, GPU 자원 분산 배정으로 반복 시간 균일화 (Fig. 12)


  • Student 추가해도 Teacher 추론 비용은 고정 → 다중 소형 모델 효율적 생성

5.3. Aligning DINOv3 with Text (dino.txt)

  • LiT 방식: Frozen visual backbone + Transformer 2 Layer, Patch Embedding·CLS token 평균화 → Text Embedding과 Contrastive 정렬
  • CLIP은 전체 정렬은 강하지만 세부 지역 대응이 약함 → DINOv3는 정밀한 텍스트-이미지 지역 연관성 제공

6. Results

6.1. Dense Features (Frozen representations, Fine-tuning 없음)

  • Baselines: PE Core, SigLIP2 (Weakly-supervised) / DINOv2, Web-DINO, Franca (SSL) / AM-RADIOv2.5, DFN, SAM, PEspatial (Agglomerative)

Qualitative: Dense Feature PCA 3차원 투영 결과, 다른 백본 대비 선명·노이즈 적음·의미적 일관성 우수 (Fig. 13)

Dense Linear Probing (Tab. 3)

  • Semantic Segmentation: SSL 대비 +6 mIoU, Weakly-supervised 대비 +13, AM-RADIOv2.5 대비 +3

  • Cityscapes: mIoU 81.1로 AM-RADIOv2.5 대비 +2.5

  • Depth estimation: 전 모델 중 최고, DINOv2 대비 KITTI RMSE -0.278 개선

6.2. Global 이미지 디스크립터

Linear Probing Classification (Fig/Tab)

  • DINOv2 대비 ImageNet-R(+10%), Sketch(+6%), ObjectNet(+13%)

  • SigLIPv2·PE와 대등하거나 근접, ImageNet-C 강건성 최고

Fine-grained Classification: iNaturalist21 89.8%로 PEcore(87.0%) 상회

Instance Recognition: Met(+10.8p), AmsterTime(+7.6p) DINOv2 대비 큰 우위

6.3. Complex Computer Vision Systems (Frozen backbone + Decoder)

Object Detection (Plain-DETR, COCO/COCO-O, Tab. 10)

  • 경량 Detector(100M)로 SOTA, COCO-O 강건성에서 300M+ 모델 능가

Semantic Segmentation (ViT-Adapter + Mask2Former, ADE20k, Tab. 11)

  • ONE-PEACE와 동등 SOTA(63.0 mIoU), COCO-Stuff·VOC2012에서도 우수


7. Full Family Evaluation

  • ViT family (S~H+): ADE20k에서 ViT-L 기준 DINOv2 대비 +6 mIoU 이상, Global recognition도 손실 없이 경쟁력 유지
  • Distillation 효과: ViT-H+가 8배 큰 ViT-7B와 유사 성능 달성 (Fig. 16b)
  • ConvNeXt (CNX, T/S/B/L): 자원 제약 환경용, Dense task에서 Supervised ConvNeXt 대비 큰 격차(CNX-T +17.9 mIoU, CNX-L +14.5 mIoU) (Tab. 15)
  • dino.txt (Zero-shot): DINOv2 대비 전 벤치마크 큰 향상, Global alignment는 CLIP류 상회하나 SigLIP2/PE에는 근소 열세, Dense alignment(ADE20k/Cityscapes)는 최상위 (Tab. 16)

10. Conclusion

  • DINOv3: SSL 분야의 중대한 발전, 신중한 Data curation·아키텍처·최적화로 데이터/모델 스케일링 성공
  • Gram anchoring: 장기 학습 중 Dense Feature 저하 문제 해결
  • 후처리 정제(Post-hoc polishing): 고해상도 후처리, Distillation 등으로 Fine-tuning 없이 다양한 Visual task에서 SOTA 달성
  • 자원 제약 환경부터 대규모 배포까지 아우르는 다재다능한 솔루션 제공

전체적으로 보면 DINOv3는 하나의 '묘수'라기보다, 스케일링 과정에서 생기는 문제들(고정 스케줄, dense feature 붕괴, 다양한 크기의 실용 모델 필요성)을 하나씩 실용적으로 풀어낸 엔지니어링의 집합에 가까움.

profile
AI Research Engineer

0개의 댓글