[논문 리뷰] Super Resolution : ML-CrAIST: Multi-scale Low-high Frequency Information-based Cross black Attention with Image Super-resolving Transformer

Soeun An·2025년 12월 15일

Paper Review

목록 보기
6/10

논문 이름 : ML-CrAIST: Multi-scale Low-high Frequency Information-based Cross black Attention with Image Super-resolving Transformer (ICPR 2024)
원본 논문 : https://arxiv.org/pdf/2408.09940
소스 코드 : https://github.com/Alik033/ML-CrAIST

키워드 : DWT, Frequency domain feature, Super Resolution

요약 : DWT을 통한 주파수 도메인 정보를 사용하여 SR

느낀 점 : FFT가 아닌 DWT을 통한 주파수 도메인 정보 활용하는 점


Introduction

Convolution based SR

  • 잔차 학습(residual learning), 밀집 연결(dense connection), 채널 어텐션(channel attention) 기법을 도입하여 발전
  • 합성곱 연산에 의한 수용 영역 제한 → global dependency을 충분히 반영 못하는 한계

Transformer based SR

  • Self-Attention 매커니즘 → global dependency을 효과적으로 학습

주파수 도메인의 정보 활용

  • 기존 SR 모델은 공간 도메인에서만 고려하고 주파수 도메인을 고려하지 않음
  • 해당 논문은 DWT로 변환한 주파수 도메인 정보의 이점을 활용하여 SR 성능 향상

Overall Methods

  • 공간 및 주파수 도메인 정보를 모두 활용한 새로운 멀티스케일 모델을 제안
  • 저주파와 고주파 서브밴드 간의 정보를 교환하기 위해 CAB을 활용한 LHFIB을 설계
  • 고주파 디테일의 정확한 복원을 위해 고주파 서브밴드들을 어텐션 메커니즘 기반의 비선형 융합 방식(AFB)을 제안
  • 다양한 스케일에서 정보성 있는 특징을 CAB를 통해 효과적으로 추출

Network 순서

  1. LR 이미지 3x3 conv, LHFIB 입력 

    • 3x3 conv (f0f_0) : SCATB N개를 통과 (fNf_N)
    • LHFIB : SR에 의미있는 주파수 정보를 추출 및 정제
      • 첫번째 LHFIB의 DWT 결과 LL_1은 두번째 LHFIB 입력으로 들어감
      • 업샘플링한 두번째 LHFIB 출력 (fsf2f^2_{sf}) , 첫번째 LHFIB 출력 (fsf1f^1_{sf})은 CAB에서 다중 스케일 특징 포함 정보(fsf1f^{1\prime}_{sf}) 로 출력
  2. 업샘플링된 fsf1f^{1\prime}_{sf}, fNf_N은 CAB에서 융합한 후 (fsf0f^0_{sf}), 3x3 conv 통과해 채널을 3s23s^2으로 출력 (s : scale factor)

  3. Pixel Shuffle을 통해 이미지를 s 배율 만큼 확대

  4. LR 이미지을 더하는 것으로 최종 SR 이미지 생성

※ Pixel Shuffle

Methods

Spatial-channel attention-based transformer block (SCATB)

  • Omni-SR에서는 OSA (Omni-Self Attention) 도입해서 공간 및 채널 차원에서 픽셀 간 상호작용을 동시에 포착
  • ML-CrAIST는 OSA, LCB, ESA을 활용해서 SCATB 구성하여 로컬 디테일과 장거리 의존성을 효과적으로 포착
  • Omni - Self Attention (OSA) :  기존 Self Attention (공간) + Channel Attention

  • Local Convolution Block (LCB) : SE(Squeeze & Excitation) 블럭 추가하여 채널별 특징 가중치 반영 및 문맥 정보 추출

  • Enhanced Spatial Attention (ESA) : conv residual block으로 핵심 중요도를 가지는 공간 정보에 집중

SCATB 작동 순서

  1. 입력 J을 LCB을 통과하여 채널 가중과 로컬 문맥 정보인 fclf^l_c 생성
  2. 1x1 conv와 depth wise 3x3 conv을 통과하여 Q K V (H x W x C)
  3. K (C x HW) / Q, V (HW x C) reshape
  4. 행렬 곱과 softmax 함수 거쳐서 Spatial attention map (HW x HW) 생성
  5. Spatial attention map과 V 행렬곱하여 JJ' 생성

===============================================================

  1. Q, V (C x HW) / K (HW x C) reshape
  2. 행렬 곱과 softmax 함수 거쳐서 Channel wise attention map (C x C) 생성
  3. Channel wise attention map과 V 행렬곱한 후, ESA 블럭에 들어가 특징을 더욱 정제한 JJ'' 생성

Low-High Frequency Interaction Block (LHFIB)

  • 주파수 정보을 사용하기 위해 2D 이산 웨이블릿 변환 (Harr)을 적용
  • LR 이미지를 LL, LH, HL, HH 4가지 서브밴드로 분해
  • LR 이미지, LL : 공간적 정보 분석
  • LH, HL, HH : 고주파 성분 보존, SR에서 고주파 디테일 강화
  • 주파수 및 공간 정보 장점 모두 활용하기 위해 LHFIB 블럭 설계
    • 입력 이미지를 2D DWT을 통해 4가지 서브밴드로 분리
    • 고주파 정보 → AFB / 저주파 정보 → SCATB 전달
    • 각 통과된 특징맵들은 CAB에서 Cross attention 수행하여 fsff_{sf} 생성

Attention - based fusion block (AFB)

  • 기존 연구들은 특징맵을 concat, add 방식으로 연결 → 네트워크 표현력을 제한
  • 비선형적인 특징 연결하는 방식인 AFB을 사용하여 관련 있는 정보를 식별하고 증폭할 수 있게 설계

AFB 동작 순서

  1. 1x1 conv와 depth wise 3x3 conv을 통과
  2. LH, HH (C x HW), HL (HW x C) reshape
  3. 행렬 곱과 softmax 함수 거쳐서 attention map fa (C x C) 생성
  4. HH과 행렬곱하고 1x1 conv 통과 + LH, HH, HL concat 1x1 conv 통과  

 Cross Attention block (CAB)

  • Cross attention을 통해 Q을 구성하는 정보를 V, K을 구성하는 정보에 반영하여 서로 다른 특징 간의 상호작용

  • LHFIB에서 사용 : F'이 저주파 특징, F"이 고주파 특징으로 들어가서 cross attiention

  • 다중 스케일에서 사용 : F'과 F"가 서로 다른 스케일 정보로 들어가서 cross attention

Loss Function

L1 loss을 사용하여 SR이미지와 HR이미지 간의 차이를 줄이는 방향으로 최적화
M : batch size

Experiments

Implementation Details

  • Train Datasets : DIV2K
  • SCATB의 개수 (N) : 5
  • Light Version (Li) :  conv 채널 수를 64 → 48

Results

PSNR, SSIM 결과

시각적 결과

LPIPS 측정 결과표

LPIPS ↓ :  VGG의 중간 layer의 feature값들을 각각 뽑아내서, 2개의 feature가 유사도 측정 낮을수록 더 인지적 품질이 우수함

추론 시간 비교

Ablation Studies

SCATB 개수 변화 실험

개수 증가에 따라 성능 향상 → 5개 이상으로는 비슷한 성능 결과 

모듈 소거 실험

PSNR, SSIM, FLOPs 결과

시각적 결과

  • Effect of AFB :  feature aggregation 과정에서 AFB 방식이 더 성능 향상에 기여함을 확인
  • Effect of multi-scale or multi-level DWT : 2-level 2dDWT와 multi-scale 학습의 중요성
  • Effect of CAB : w/o CAB = element wise 덧셈
  • Effect of LHFIB : 주파수 정보 사용 시 더 우수하고 모델의 표현 능력을 향상시키기 위해 전역적 의존성을 제공함을 확인

LHFIB, CAB 유무로 에폭에 따른 로스 수렴 그래프

Full Model이 제일 빨리 수렴

LPIPS, BRISQUE, EPI

  • BRISQUE ↓ : No-reference 화질 평가 지표로 낮을수록 우수
  • EPI ↑ : Edge Preservation Index로 엣지 보존 정도를 의미

  • LPIPS : w/o AFB (concat), w/o LHFIB 순으로 가장 큰 차이를 보임 
  • BRISQUE : DWT_L1,  w/o AFB (concat) 순으로 가장 큰 차이를 보임
  • EPI : w/o LHFIB, w/o AFB (Add) 순으로 가장 큰 차이를 보임

시각적 품질에서는 AFB,  엣지 보존에서는 LHFIB이 가장 큰 영향을 미치는 것을 확인할 수 있음

엣지 검출 결과

  • 1행 : SIFT 방식으로 특징점 검출 결과
  • 2행 : Canny 엣지 검출 결과

타 방법론들에 비해 많은 특징점 검출하고 다른 방법론들은 검출하지 못한 엣지 검출하는 우수함을 보임

0개의 댓글