논문 이름 : Super Resolution : Robust Reference-based Super-Resolution via C2-Matching (CVPR 2021)
원본 논문 : https://arxiv.org/pdf/2106.01863
소스 코드 : https://github.com/yumingj/C2-Matching
키워드 : Reference based Super Resolution, knowledge distillation
요약 : HR-HR매칭을 지식증류로 HR-LR에 전이함, DCN을 통해서 정렬
느낀 점 : 기존 RefSR 성능에서 급상승을 보여줌, DCN과 지식 증류 인코더가 아주 큰 역할을 함
Introduction
-
Reference based Super Resolution
- 단일 이미지 초해상화와 달리 Ref-SR은 HR 참조 이미지를 활용하여 LR 이미지를 복원
- Ref-SR의 핵심 : 입력 이미지와 참조 이미지간의 대응 관계 파악하여 HR 텍스처를 전송
-
Transformation Gap : 같은 객체와 텍스처라도 입력 이미지와 참조 이미지 간의 스케일, 회전 차이 존재
-
Resolution Gap : LR 입력 이미지와 HR 참조 이미지 간의 정보 불균형 존재 세밀한 텍스처 영역에서 정확한 대응 찾기 어려움

Overall Methods
- Transformation gap : 강건한 대응성을 학습하는 contrastive correspondence network 제안
- Resolution gap : 더 쉬운 HR-HR 매칭을 teacher로 LR-HR 매칭을 student로 하는 지식 증류 방법으로 학습
- Restoration 단계에서 참조 이미지를 더 나은 정보 통합로 위해 Deformable Convolution Network 사용
- scale, rotation 변화에 대한 견고성을 입증할 수 있는 WR-SR 테스트 데이터셋 제안

Methods
Contrastive Correspondence Network
-
입력 이미지와 참조 이미지 간의 대응 관계 계산하기 위해 이미지 간의 서로 유사한 영역 위치 지정
-
기존 방법론들은 VGG 특징맵 or 훈련하면서 추출한 특징맵으로 대응 관계 계산-> Trasformation gap에 취약
-
Contrastive Correspondence Network은 LR 이미지와 HR 참조 이미지의 해상도 다르므로 가중치를 공유하지 않는 같은 두 개의 특징 추출 모델로 구성

-
학습 시, HR 입력 이미지에 homography 변환을 적용하여 HR 참조 이미지 (I′)에 합성
-
Homography 변환 : 입력 이미지 시점에 대해 참조 이미지를 변환하여 대응하는 쌍을 얻을 수 있음
→ 입력 이미지의 각 포인트 p에 대해 대응하는 참조 이미지 포인트 p′ 쌍이 생성
-
Triplet Margin Ranking Loss
- Positive pair는 거리를 가깝게, Negative pair는 거리를 멀게하여 최적화
- Positive Pair : 입력 이미지 포인트 p의 descriptor 와 대응하는 참조 이미지 포인트 p'의 descriptor
- Negative Pair : 진짜 Positive와 구별하기 어려운 Negative를 멀리 보내도록 학습
- Margin : Negative와 Positve가 최소 m만큼은 떨어져 있게 유지

-
Negative Pair : 진짜 Positive와 구별하기 어려운 Negative를 멀리 보내도록 학습
- 첫번째 텀 k : LR 입력 이미지 입장에서 혼동이 되는 HR 참조 이미지 포인트
p와 대응하는 p'이 아닌 T 이상 거리가 존재하는 포인트들 중 제일 LR 입력 이미지와 유사한 HR 참조 이미지의 한 포인트
- 두번째 텀 k : HR 참조 이미지 입장에서 혼동이 되는 LR 입력 이미지 포인트
p'와 대응하는 p가 아닌 T 이상 거리가 존재하는 포인트들 중 제일 HR 참조 이미지와 유사한 LR 입력 이미지의 한 포인트
- 각 텀들 중 최소 값을 Negative Pair로 사용


Teacher-Student Correlation Distillation
- LR 이미지에서는 많은 정보를 놓치기 때문에, LR-HR 간의 correspondence matching이 좋지 않음
→ resolution gap을 줄이기 위해 knowledge distillation을 제안
- 같은 구조의 모델에 입력을 다르게 하여 HR–HR 매칭의 능력을 LR–HR 매칭으로 이전
- Teacher Model : HR 입력 이미지 - HR 참조 이미지를 입력
- Student Model : LR 입력 이미지 - HR 참조 이미지를 입력
- Teacher 모델의 correlation volume에 Student 모델의 correlation volume을 가깝게 만들도록 학습

Dynamic Aggregation Module
- 참조 이미지에서 텍스처를 융합
- 입력 이미지 포인트 p에 대응하는 참조 이미지 포인트 p'을 생성
→ p와 가장 높은 correlation을 가진 참조 이미지 포인트 q를 p′로 선택
- Deformable Convolution Network
-
- 참조 이미지 특징맵을 DCN을 통해 LR 이미지에 맞게 융합
- 입력 포인트와 참조 포인트 사이의 공간적 차이



Restoration Module
- 입력 이미지의 특징맵과 Dyn - Agg 통과한 참조 이미지 특징맵 (Aggregated Reference Features)을 가지고 복원
- 두 feature들을 concat하고 Residual Blocks를 거쳐 SR 이미지 복원

Loss Functions
L1 Loss, Perceptual Loss, Adversarial Loss

Experiments
WR-SR Test Dataset
- CUFED5 dataset 경우 동일한 상황에서 만든 참조 이미지를 사용

- 실제 상황은 동일한 상황에서 생성되지 않는 참조 이미지를 사용할 경우도 존재
- 구글 이미지와 검색 엔진으로 서치해서 만든 WR-SR 데이터셋 제안

Results


Ablation Studies
모듈 소거 실험
- Baseline
- Dyn - Agg : Dynamic Aggregation Module 만 추가했을 때
- Contras : Dyn - Agg + Contrastive Correspondence Network
- TS Corr : Dyn - Agg + Contrastive Correspondence Network + Teacher-Student - Correlation Distillation

Ref 스케일 변화 강도, 회전 변화 강도에 대한 성능 실험

AEE : Average End-to-point Error으로 대응 관계 매칭 간의 오차를 나타냄
User Study
20명에게 CUFED5 dataset 결과 설문조사

모델 파라미터 수 비교
