논문 이름 : Efficient Reference-Based Super Resolution for Product Image with Frequency-Spatial Aggregation (World Scientific Publishing Company International Journal of Information Technology & Decision Making 2025)
원본 논문 : https://www.worldscientific.com/doi/10.1142/S021962202550049X?srsltid=AfmBOoqhVNDmoWg-w8hRtqG9KO6AbmgZsCEzkbpcuRra9Fze0gi-yI3h
소스 코드 :
키워드 : Super Resolution, Spatial and frequency information, RefSR
요약 : RefSR에 주파수 도메인 정보 추가
느낀 점 : 내가 하던 실험과 유사한 실험이라 참고하기 좋음
Introduction
- 온라인 제품 이미지의 중요성
- 온라인 쇼핑에서는 시각적 정보가 소비자 의사결정에 직접적인 영향을 미침
- 이미지는 풍부하고 생생한 시각 정보로 직접적인 체험 부족을 보완 → 제품에 대한 신뢰감과 구매 의도를 높임
- 이미지 품질의 영향
- 고품질 이미지는 웹사이트 방문자 수 및 체류 시간 증가
- 긍정적인 감정 경험을 제공하여 브랜드 이미지 강화
- 온라인 제품 이미지의 초해상화
- RefSR은 SISR보다 성능이 뛰어나지만 참조 이미지의 품질과 가용성 제약 존재
- 온라인 제품에서는 다양한 각도, 장면의 이미지가 존재하므로 이를 참조 이미지로 활용 가능

- LAM과 Receptive Field
- LAM : Local Attention Map 특정 부분을 복원하기 위해 어느 정도 픽셀들이 관여하는지 보여주는 맵
- 수용 영역을 넓히면 더 많은 관련 픽셀을 활용하므로 고품질 이미지 복원이 가능함을 보여줌
- RefSR 원리
- 참조 이미지는 feature matching을 통해 고해상도 정보를 저해상도 이미지로 전달
- 작은 수용 영역은 잘못된 텍스처 학습을 유발
- 넓은 수용 영역은 장거리 특징을 학습해 incorrect matching 영향을 감소시킴 → LAM이 좋을수록 RefSR 성능 향상
- 기존 연구들은 넓은 수용 영역을 확보하기 위해 Residual Blocks, self attention을 활용
- 이러한 연구들은 계산량이 많고 효율성이 낮아 실제 제품 이미지 복원에는 비효율

- 푸리에 변환 in Super Resolution
- 스펙트럼 합성 정리 : 주파수 값의 변화가 모든 픽셀에 전역적 영향 → 주파수 특징은 전역적 수용 영역
- 진폭 : 이미지 스타일, 노출, 조명 관련 / 위상 : 이미지의 의미적 구조
- Fast Fourier Convolution (FFC) : 표준 합성곱을 주파수 브랜치, 공간 브랜치로 나누어서 결합 구조로 대체
- 신경망은 본질적으로 저주파 정보만 생성하는 경향이 있어, 합성 이미지와 실제 이미지 간에 주파수 갭이 발생
- 주파수 영역 손실(Frequency Domain Loss)을 도입하여 고주파 성분 복원 능력을 향상
- 일부 연구들은 진폭과 위상을 분리하여 복원하는 방식 사용
Contributions
- 푸리에 변환을 이용해 참조 이미지의 전역 정보를 효과적으로 활용하는 새로운 참조 기반 초해상도 네트워크를 제안
- U-Net 판별기를 사용하여 생성된 이미지의 지각적 품질을 향상
- 제안된 방법은 더 적은 파라미터로 SOTA 성능을 달성
- 온라인 쇼핑몰에서 수집된 제품 이미지 쌍으로 구성된 새로운 벤치마크 데이터셋 PRSR(Product Reference SR)을 구축
이 데이터셋은 온라인 제품 전시를 위한 초해상도 연구를 더욱 촉진할 것으로 기대
- RefSR의 4단계 구성 : Extraction → Matching → Alignment → Reconstruction
- Extraction : LR 이미지는 bicubic 업샘플링 후, 사전 학습된 네트워크로 특징 맵 추출
- Mathcing : LR·Ref 이미지를 3×3 패치로 분할 → 각 LR 패치에 대해 가장 유사한 Ref 패치 탐색
- Alignment : Ref와 LR 패치 간의 공간 차이(Δp) 계산 → DCN(Deformable Convolution)으로 위치 보정 및 특징 정렬 수행
- Reconstruction : 정렬된 참조 특징과 LR 특징을 결합하여 다중 스케일 복원 모듈에서 SR 이미지 생성

Methods
Feature Extraction and Matching
- Feature Extractor, Content Extractor, Deformable Alignment Module은 C2-Matching과 동일한 구조를 채택
- Extraction : LR 이미지는 bicubic 업샘플링 후, 사전 학습된 네트워크로 특징 맵 추출

i번째 LR 패치와 가장 유사한 Ref 패치의 위치의 차를 계산
→ LR와 가장 유사한 패치는 이 Ref 패치이지만 Δp 공간 차이만큼 다름 차이를 잘 극복해서 feature을 통합해야 함


-
Alignment : Ref와 LR 패치 간의 공간 차이 (Δp) → DCN(Deformable Convolution)으로 위치 보정 및 특징 정렬 수행
Content Extractor에서 추출한 LR과 Ref 특징맵, Δp을 DCN에 입력하여 재정렬
재정렬된 특징맵과 LR 특징맵을 concat하여 다음 모듈에 입력
-
Reconstruction : 정렬된 참조 특징과 LR 특징을 결합하여 다중 스케일 복원, FSA 모듈에서 SR 이미지 생성
Frequency-Spatial Aggregation Block
- Spatial Branch : Residual Block → 지역적 공간 특징 추출
- 3×3 Conv + LeakyReLU + 3×3 Conv
- Spatial Branch : Fourier Transform → 전역 주파수 특징 추출
- 1×1 Conv + LeakyReLU → FFT2D
- Conv + LeakyReLU로 전역 정보 학습 후 Inverse FFT2D로 공간 복원 → Skip connection + 1×1 Conv
- 각 브랜치 공간·주파수 특징 결합 → 3×3 Conv로 통합

- Feed Forward Network
- 전역·지역 정보를 통합 및 학습
- (Conv1×1 + Depthwise Conv3×3 + GELU), (Conv1×1 + Depthwise Conv3×3) 두 그룹으로 구성
- 각 그룹 출력을 곱하고 Conv1×1 + Skip connection으로 통합하여 최종 출력 생성
U-Net Discriminator
- 기존 VGG-style Discriminator는 이미지 전체 수준에서만 진위 여부를 판단
- 결과적으로 지역적 구조(Local Structure)가 깨지고 불연속적이고 얼룩진 텍스처 발생
- Encoder: 이미지 단위(real/fake) 분류
- Decoder: 픽셀 단위 판별 → 공간적 일관성 유지

Loss Functions
- Reconstruction Loss : 구조적 유사성을 보장하기 위해 L1 Loss 사용
- Frequency Loss : 고주파 세부 정보을 복원하가 위해 FFT 기반 손실 도입
- Perceptual Loss : VGG19 특징맵 기반 차이 최소화하여 시각적 품질 향상
- Adversarial Loss : U-Net 판별기로부터 픽셀 단위의 피드백을 받아 세밀한 질감을 학습

Product Reference Super Resolution Datasets
- 실제 온라인 제품 이미지를 활용하여 RefSR 모델의 현실적 성능 검증하고 복잡한 질감과 구조를 가진 제품의 복원 능력 평가 목표
- 제품 복잡도에 따라 5개 카테고리 선정 → 의류 · 전자제품 · 식품 · 장식품 · 가구
- HR 및 Ref 해상도: 400×400 ~ 900×900
- 총 28쌍의 이미지 수집
- 주요 피사체가 제품이 되도록 불필요한 영역 크롭

Experiments
Implementaion details
batch size : 16
a Geforce 3090 GPU
L1 Loss, Frequency Loss 먼저 150k iterations 학습
이후, Adv Loss와 Per Loss 추가하여 150k iterations 학습
Results


LAM (Local Attribution Map) 시각화 결과
- LAM(DI) 시각화에서는 제안 모델이 DATSR 보다 더 넓은 픽셀 범위를 사용 → 더 넓은 전역적 재구성 영역 확보

모델 효율성
- 네트워크 파라미터 수, GPU 메모리 사용량, 추론 속도, 성능 모든 실험은 NVIDIA GeForce RTX 3090 GPU 환경에서 수행

Results on Product Dataset
