[논문 리뷰] Super Resolution : Robust Reference-based Super-Resolution via C2-Matching

Soeun An·2025년 12월 16일

Paper Review

목록 보기
7/10

논문 이름 : Super Resolution : Robust Reference-based Super-Resolution via C2-Matching (CVPR 2021)
원본 논문 : https://arxiv.org/pdf/2106.01863
소스 코드 : https://github.com/yumingj/C2-Matching

키워드 : Reference based Super Resolution, knowledge distillation

요약 : HR-HR매칭을 지식증류로 HR-LR에 전이함, DCN을 통해서 정렬

느낀 점 : 기존 RefSR 성능에서 급상승을 보여줌, DCN과 지식 증류 인코더가 아주 큰 역할을 함


Introduction

  • Reference based Super Resolution

    • 단일 이미지 초해상화와 달리 Ref-SR은 HR 참조 이미지를 활용하여 LR 이미지를 복원
    • Ref-SR의 핵심 : 입력 이미지와 참조 이미지간의 대응 관계 파악하여 HR 텍스처를 전송
  • Transformation Gap : 같은 객체와 텍스처라도 입력 이미지와 참조 이미지 간의 스케일, 회전 차이 존재

  • Resolution Gap : LR 입력 이미지와 HR 참조 이미지 간의 정보 불균형 존재 세밀한 텍스처 영역에서 정확한 대응 찾기 어려움

Overall Methods

  • Transformation gap : 강건한 대응성을 학습하는 contrastive correspondence network 제안
  • Resolution gap : 더 쉬운 HR-HR 매칭을 teacher로 LR-HR 매칭을 student로 하는 지식 증류 방법으로 학습
  • Restoration 단계에서 참조 이미지를 더 나은 정보 통합로 위해 Deformable Convolution Network 사용 
  • scale, rotation 변화에 대한 견고성을 입증할 수 있는 WR-SR 테스트 데이터셋 제안

Methods

Contrastive Correspondence Network

  • 입력 이미지와 참조 이미지 간의 대응 관계 계산하기 위해 이미지 간의 서로 유사한 영역 위치 지정

  • 기존 방법론들은 VGG 특징맵 or 훈련하면서 추출한 특징맵으로 대응 관계 계산-> Trasformation gap에 취약

  • Contrastive Correspondence Network은 LR 이미지와 HR 참조 이미지의 해상도 다르므로 가중치를 공유하지 않는 같은 두 개의 특징 추출 모델로 구성

  • 학습 시, HR 입력 이미지에 homography 변환을 적용하여 HR 참조 이미지 (II')에 합성

  • Homography 변환 : 입력 이미지 시점에 대해 참조 이미지를 변환하여 대응하는 쌍을 얻을 수 있음
    → 입력 이미지의 각 포인트 pp에 대해 대응하는 참조 이미지 포인트 pp' 쌍이 생성

  • Triplet Margin Ranking Loss

    • Positive pair는 거리를 가깝게, Negative pair는 거리를 멀게하여 최적화
    • Positive Pair : 입력 이미지 포인트 p의 descriptor 와 대응하는 참조 이미지 포인트 p'의 descriptor
    • Negative Pair : 진짜 Positive와 구별하기 어려운 Negative를 멀리 보내도록 학습
    • Margin : Negative와 Positve가 최소 m만큼은 떨어져 있게 유지

  • Negative Pair : 진짜 Positive와 구별하기 어려운 Negative를 멀리 보내도록 학습
    - 첫번째 텀 k : LR 입력 이미지 입장에서 혼동이 되는 HR 참조 이미지 포인트
    p와 대응하는 p'이 아닌 T 이상 거리가 존재하는 포인트들 중 제일 LR 입력 이미지와 유사한 HR 참조 이미지의 한 포인트
    - 두번째 텀 k : HR 참조 이미지 입장에서 혼동이 되는 LR 입력 이미지 포인트
    p'와 대응하는 p가 아닌 T 이상 거리가 존재하는 포인트들 중 제일 HR 참조 이미지와 유사한 LR 입력 이미지의 한 포인트 
    - 각 텀들 중 최소 값을 Negative Pair로 사용

Teacher-Student Correlation Distillation

  • LR 이미지에서는 많은 정보를 놓치기 때문에, LR-HR 간의 correspondence matching이 좋지 않음
    → resolution gap을 줄이기 위해 knowledge distillation을 제안
  • 같은 구조의 모델에 입력을 다르게 하여 HR–HR 매칭의 능력을 LR–HR 매칭으로 이전
    • Teacher Model : HR 입력 이미지 - HR 참조 이미지를 입력
    • Student Model : LR 입력 이미지 - HR 참조 이미지를 입력
  • Teacher 모델의 correlation volume에 Student 모델의 correlation volume을 가깝게 만들도록 학습

  • Correlation Volume

    • 입력 이미지에 N개의 descriptor, 참조 이미지에 M개 descriptor → 모든 쌍에 대한 N*M 크기의 상관관계 볼륨 생성

    • 입력 이미지의 포인트 p와 참조 이미지의 포인트 q에 대한 소프트 맥스 통해 확률 분포를 계산

  • Teacher 모델의 correlation volume에 Student 모델의 correlation volume을 가깝게 만들도록 학습

    • 각 입력 descriptor p에 대해, 두 분포의 차이를 KL-divergence로 계산
    • KL divergence : 두 확률 분포가 얼마나 다른지 측정
    • 두 분포의 차이를 나타낸 KL-divergence를 최소화하는 방향으로 학습

Dynamic Aggregation Module

  • 참조 이미지에서 텍스처를 융합
  • 입력 이미지 포인트 p에 대응하는 참조 이미지 포인트 p'을 생성 
    → p와 가장 높은 correlation을 가진 참조 이미지 포인트 q를 p′로 선택
  • Deformable Convolution Network
    -
    - 참조 이미지 특징맵을 DCN을 통해 LR 이미지에 맞게 융합
    - 입력 포인트와 참조 포인트 사이의 공간적 차이

Restoration Module

  • 입력 이미지의 특징맵과 Dyn - Agg  통과한 참조 이미지 특징맵 (Aggregated Reference Features)을 가지고 복원
  • 두 feature들을 concat하고 Residual Blocks를 거쳐 SR 이미지 복원

Loss Functions

L1 Loss, Perceptual Loss, Adversarial Loss

Experiments

WR-SR Test Dataset

  • CUFED5 dataset 경우 동일한 상황에서 만든 참조 이미지를 사용 
  • 실제 상황은 동일한 상황에서 생성되지 않는 참조 이미지를 사용할 경우도 존재
  • 구글 이미지와 검색 엔진으로 서치해서 만든 WR-SR 데이터셋 제안

Results

Ablation Studies

모듈 소거 실험

  • Baseline 
  • Dyn - Agg :  Dynamic Aggregation Module 만 추가했을 때
  • Contras : Dyn - Agg + Contrastive Correspondence Network
  • TS Corr : Dyn - Agg + Contrastive Correspondence Network + Teacher-Student - Correlation Distillation

Ref 스케일 변화 강도, 회전 변화 강도에 대한 성능 실험

AEE : Average End-to-point Error으로 대응 관계 매칭 간의 오차를 나타냄

User Study

20명에게 CUFED5 dataset 결과 설문조사

모델 파라미터 수 비교

0개의 댓글