[논문 리뷰] Super Resolution : Efficient Reference-Based Super Resolution for Product Image with Frequency-Spatial Aggregation

Soeun An·2025년 12월 17일

Paper Review

목록 보기
9/10

논문 이름 : Efficient Reference-Based Super Resolution for Product Image with Frequency-Spatial Aggregation (World Scientific Publishing Company International Journal of Information Technology & Decision Making 2025)
원본 논문 : https://www.worldscientific.com/doi/10.1142/S021962202550049X?srsltid=AfmBOoqhVNDmoWg-w8hRtqG9KO6AbmgZsCEzkbpcuRra9Fze0gi-yI3h
소스 코드 :

키워드 : Super Resolution, Spatial and frequency information, RefSR

요약 : RefSR에 주파수 도메인 정보 추가

느낀 점 : 내가 하던 실험과 유사한 실험이라 참고하기 좋음


Introduction

  • 온라인 제품 이미지의 중요성
    • 온라인 쇼핑에서는 시각적 정보가 소비자 의사결정에 직접적인 영향을 미침
    • 이미지는 풍부하고 생생한 시각 정보로 직접적인 체험 부족을 보완 → 제품에 대한 신뢰감과 구매 의도를 높임
  • 이미지 품질의 영향
    • 고품질 이미지는 웹사이트 방문자 수 및 체류 시간 증가
    • 긍정적인 감정 경험을 제공하여 브랜드 이미지 강화
  • 온라인 제품 이미지의 초해상화
    • RefSR은 SISR보다 성능이 뛰어나지만 참조 이미지의 품질과 가용성 제약 존재
    • 온라인 제품에서는 다양한 각도, 장면의 이미지가 존재하므로 이를 참조 이미지로 활용 가능
  • LAM과 Receptive Field
    • LAM : Local Attention Map 특정 부분을 복원하기 위해 어느 정도 픽셀들이 관여하는지 보여주는 맵
    • 수용 영역을 넓히면 더 많은 관련 픽셀을 활용하므로 고품질 이미지 복원이 가능함을 보여줌
  • RefSR 원리
    • 참조 이미지는 feature matching을 통해 고해상도 정보를 저해상도 이미지로 전달
    • 작은 수용 영역은 잘못된 텍스처 학습을 유발 
    • 넓은 수용 영역은 장거리 특징을 학습해 incorrect matching 영향을 감소시킴 → LAM이 좋을수록 RefSR 성능 향상
  • 기존 연구들은 넓은 수용 영역을 확보하기 위해 Residual Blocks, self attention을 활용
  • 이러한 연구들은 계산량이 많고 효율성이 낮아 실제 제품 이미지 복원에는 비효율

  • 푸리에 변환 in Super Resolution
    • 스펙트럼 합성 정리 : 주파수 값의 변화가 모든 픽셀에 전역적 영향 → 주파수 특징은 전역적 수용 영역
    • 진폭 : 이미지 스타일, 노출, 조명 관련 / 위상 : 이미지의 의미적 구조
    • Fast Fourier Convolution (FFC) : 표준 합성곱을 주파수 브랜치,  공간 브랜치로 나누어서 결합 구조로 대체
    • 신경망은 본질적으로 저주파 정보만 생성하는 경향이 있어, 합성 이미지와 실제 이미지 간에 주파수 갭이 발생
    • 주파수 영역 손실(Frequency Domain Loss)을 도입하여 고주파 성분 복원 능력을 향상
    • 일부 연구들은 진폭과 위상을 분리하여 복원하는 방식 사용

Contributions

  • 푸리에 변환을 이용해 참조 이미지의 전역 정보를 효과적으로 활용하는 새로운 참조 기반 초해상도 네트워크를 제안
  • U-Net 판별기를 사용하여 생성된 이미지의 지각적 품질을 향상
  • 제안된 방법은 더 적은 파라미터로 SOTA 성능을 달성
  • 온라인 쇼핑몰에서 수집된 제품 이미지 쌍으로 구성된 새로운 벤치마크 데이터셋 PRSR(Product Reference SR)을 구축
    이 데이터셋은 온라인 제품 전시를 위한 초해상도 연구를 더욱 촉진할 것으로 기대

Problem Formulation

  • RefSR의 4단계 구성 : Extraction  →  Matching  →  Alignment  →  Reconstruction
  • Extraction : LR 이미지는 bicubic 업샘플링 후, 사전 학습된 네트워크로 특징 맵 추출
  • Mathcing :  LR·Ref 이미지를 3×3 패치로 분할 → 각 LR 패치에 대해 가장 유사한 Ref 패치 탐색
  • Alignment : Ref와 LR 패치 간의 공간 차이(Δp) 계산 → DCN(Deformable Convolution)으로 위치 보정 및 특징 정렬 수행
  • Reconstruction : 정렬된 참조 특징과 LR 특징을 결합하여 다중 스케일 복원 모듈에서 SR 이미지 생성

Methods

Feature Extraction and Matching

  • Feature Extractor, Content Extractor, Deformable Alignment Module은 C2-Matching과 동일한 구조를 채택
  • Extraction : LR 이미지는 bicubic 업샘플링 후, 사전 학습된 네트워크로 특징 맵 추출

  • Matching :  LR·Ref 이미지를 3×3 패치로 분할 → 각 LR 패치에 대해 가장 유사한 Ref 패치 탐색

  • <> : 정규화된 내적으로 i번째 LR 패치와 가장 유사한 j번째 Ref 패치의 위치를 계산

i번째 LR 패치와 가장 유사한 Ref 패치의 위치의 차를 계산
→ LR와 가장 유사한 패치는 이 Ref 패치이지만 Δp 공간 차이만큼 다름 차이를 잘 극복해서 feature을 통합해야 함


  • Alignment : Ref와 LR 패치 간의 공간 차이 (Δp)  → DCN(Deformable Convolution)으로 위치 보정 및 특징 정렬 수행
    Content Extractor에서 추출한 LR과 Ref 특징맵, Δp을 DCN에 입력하여 재정렬
    재정렬된 특징맵과 LR 특징맵을 concat하여 다음 모듈에 입력

  • Reconstruction : 정렬된 참조 특징과 LR 특징을 결합하여 다중 스케일 복원, FSA 모듈에서 SR 이미지 생성

Frequency-Spatial Aggregation Block

  • Spatial Branch : Residual Block → 지역적 공간 특징 추출 
    • 3×3 Conv + LeakyReLU  + 3×3 Conv
  • Spatial Branch : Fourier Transform → 전역 주파수 특징 추출
    • 1×1 Conv + LeakyReLU → FFT2D
    • Conv + LeakyReLU로 전역 정보 학습 후 Inverse FFT2D로 공간 복원 → Skip connection + 1×1 Conv
  • 각 브랜치 공간·주파수 특징 결합 → 3×3 Conv로 통합

  • Feed Forward Network
    • 전역·지역 정보를 통합 및 학습 
    • (Conv1×1 + Depthwise Conv3×3 + GELU), (Conv1×1 + Depthwise Conv3×3) 두 그룹으로 구성
    • 각 그룹 출력을 곱하고 Conv1×1 + Skip connection으로 통합하여 최종 출력 생성

U-Net Discriminator

  • 기존 VGG-style Discriminator는 이미지 전체 수준에서만 진위 여부를 판단 
  • 결과적으로 지역적 구조(Local Structure)가 깨지고 불연속적이고 얼룩진 텍스처 발생
  • Encoder: 이미지 단위(real/fake) 분류
  • Decoder: 픽셀 단위 판별 → 공간적 일관성 유지

Loss Functions

  • Reconstruction Loss : 구조적 유사성을 보장하기 위해 L1 Loss 사용
  • Frequency Loss : 고주파 세부 정보을 복원하가 위해 FFT 기반 손실 도입
  • Perceptual Loss : VGG19 특징맵 기반 차이 최소화하여 시각적 품질 향상
  • Adversarial Loss : U-Net 판별기로부터 픽셀 단위의 피드백을 받아 세밀한 질감을 학습

Product Reference Super Resolution Datasets

  • 실제 온라인 제품 이미지를 활용하여 RefSR 모델의 현실적 성능 검증하고 복잡한 질감과 구조를 가진 제품의 복원 능력 평가 목표
  • 제품 복잡도에 따라 5개 카테고리 선정 → 의류 · 전자제품 · 식품 · 장식품 · 가구
  • HR 및 Ref 해상도: 400×400 ~ 900×900
  • 총 28쌍의 이미지 수집
  • 주요 피사체가 제품이 되도록 불필요한 영역 크롭

Experiments

Implementaion details

batch size : 16
a Geforce 3090 GPU
L1 Loss, Frequency Loss 먼저 150k iterations 학습
이후, Adv Loss와 Per Loss 추가하여 150k iterations 학습

Results

LAM (Local Attribution Map) 시각화 결과

  • LAM(DI) 시각화에서는 제안 모델이 DATSR 보다 더 넓은 픽셀 범위를 사용 → 더 넓은 전역적 재구성 영역 확보

모델 효율성

  • 네트워크 파라미터 수, GPU 메모리 사용량, 추론 속도, 성능 모든 실험은 NVIDIA GeForce RTX 3090 GPU 환경에서 수행

Results on Product Dataset

0개의 댓글