논문 이름 : ML-CrAIST: Multi-scale Low-high Frequency Information-based Cross black Attention with Image Super-resolving Transformer (ICPR 2024)
원본 논문 : https://arxiv.org/pdf/2408.09940
소스 코드 : https://github.com/Alik033/ML-CrAIST
키워드 : DWT, Frequency domain feature, Super Resolution
요약 : DWT을 통한 주파수 도메인 정보를 사용하여 SR
느낀 점 : FFT가 아닌 DWT을 통한 주파수 도메인 정보 활용하는 점
Introduction
Convolution based SR
- 잔차 학습(residual learning), 밀집 연결(dense connection), 채널 어텐션(channel attention) 기법을 도입하여 발전
- 합성곱 연산에 의한 수용 영역 제한 → global dependency을 충분히 반영 못하는 한계
- Self-Attention 매커니즘 → global dependency을 효과적으로 학습
주파수 도메인의 정보 활용
- 기존 SR 모델은 공간 도메인에서만 고려하고 주파수 도메인을 고려하지 않음
- 해당 논문은 DWT로 변환한 주파수 도메인 정보의 이점을 활용하여 SR 성능 향상

Overall Methods
- 공간 및 주파수 도메인 정보를 모두 활용한 새로운 멀티스케일 모델을 제안
- 저주파와 고주파 서브밴드 간의 정보를 교환하기 위해 CAB을 활용한 LHFIB을 설계
- 고주파 디테일의 정확한 복원을 위해 고주파 서브밴드들을 어텐션 메커니즘 기반의 비선형 융합 방식(AFB)을 제안
- 다양한 스케일에서 정보성 있는 특징을 CAB를 통해 효과적으로 추출

Network 순서
-
LR 이미지 3x3 conv, LHFIB 입력
- 3x3 conv (f0) : SCATB N개를 통과 (fN)
- LHFIB : SR에 의미있는 주파수 정보를 추출 및 정제
- 첫번째 LHFIB의 DWT 결과 LL_1은 두번째 LHFIB 입력으로 들어감
- 업샘플링한 두번째 LHFIB 출력 (fsf2) , 첫번째 LHFIB 출력 (fsf1)은 CAB에서 다중 스케일 특징 포함 정보(fsf1′) 로 출력
-
업샘플링된 fsf1′, fN은 CAB에서 융합한 후 (fsf0), 3x3 conv 통과해 채널을 3s2으로 출력 (s : scale factor)
-
Pixel Shuffle을 통해 이미지를 s 배율 만큼 확대
-
LR 이미지을 더하는 것으로 최종 SR 이미지 생성
※ Pixel Shuffle

Methods

- Omni-SR에서는 OSA (Omni-Self Attention) 도입해서 공간 및 채널 차원에서 픽셀 간 상호작용을 동시에 포착
- ML-CrAIST는 OSA, LCB, ESA을 활용해서 SCATB 구성하여 로컬 디테일과 장거리 의존성을 효과적으로 포착
-
Omni - Self Attention (OSA) : 기존 Self Attention (공간) + Channel Attention
-
Local Convolution Block (LCB) : SE(Squeeze & Excitation) 블럭 추가하여 채널별 특징 가중치 반영 및 문맥 정보 추출

-
Enhanced Spatial Attention (ESA) : conv residual block으로 핵심 중요도를 가지는 공간 정보에 집중

SCATB 작동 순서
- 입력 J을 LCB을 통과하여 채널 가중과 로컬 문맥 정보인 fcl 생성
- 1x1 conv와 depth wise 3x3 conv을 통과하여 Q K V (H x W x C)
- K (C x HW) / Q, V (HW x C) reshape
- 행렬 곱과 softmax 함수 거쳐서 Spatial attention map (HW x HW) 생성
- Spatial attention map과 V 행렬곱하여 J′ 생성
===============================================================
- Q, V (C x HW) / K (HW x C) reshape
- 행렬 곱과 softmax 함수 거쳐서 Channel wise attention map (C x C) 생성
- Channel wise attention map과 V 행렬곱한 후, ESA 블럭에 들어가 특징을 더욱 정제한 J′′ 생성
Low-High Frequency Interaction Block (LHFIB)

- 주파수 정보을 사용하기 위해 2D 이산 웨이블릿 변환 (Harr)을 적용
- LR 이미지를 LL, LH, HL, HH 4가지 서브밴드로 분해
- LR 이미지, LL : 공간적 정보 분석
- LH, HL, HH : 고주파 성분 보존, SR에서 고주파 디테일 강화
- 주파수 및 공간 정보 장점 모두 활용하기 위해 LHFIB 블럭 설계
- 입력 이미지를 2D DWT을 통해 4가지 서브밴드로 분리
- 고주파 정보 → AFB / 저주파 정보 → SCATB 전달
- 각 통과된 특징맵들은 CAB에서 Cross attention 수행하여 fsf 생성
Attention - based fusion block (AFB)

- 기존 연구들은 특징맵을 concat, add 방식으로 연결 → 네트워크 표현력을 제한
- 비선형적인 특징 연결하는 방식인 AFB을 사용하여 관련 있는 정보를 식별하고 증폭할 수 있게 설계
AFB 동작 순서
- 1x1 conv와 depth wise 3x3 conv을 통과
- LH, HH (C x HW), HL (HW x C) reshape
- 행렬 곱과 softmax 함수 거쳐서 attention map fa (C x C) 생성
- HH과 행렬곱하고 1x1 conv 통과 + LH, HH, HL concat 1x1 conv 통과
Cross Attention block (CAB)

-
Cross attention을 통해 Q을 구성하는 정보를 V, K을 구성하는 정보에 반영하여 서로 다른 특징 간의 상호작용
-
LHFIB에서 사용 : F'이 저주파 특징, F"이 고주파 특징으로 들어가서 cross attiention
-
다중 스케일에서 사용 : F'과 F"가 서로 다른 스케일 정보로 들어가서 cross attention
Loss Function

L1 loss을 사용하여 SR이미지와 HR이미지 간의 차이를 줄이는 방향으로 최적화
M : batch size
Experiments
Implementation Details
- Train Datasets : DIV2K
- SCATB의 개수 (N) : 5
- Light Version (Li) : conv 채널 수를 64 → 48
Results
PSNR, SSIM 결과

시각적 결과

LPIPS 측정 결과표

LPIPS ↓ : VGG의 중간 layer의 feature값들을 각각 뽑아내서, 2개의 feature가 유사도 측정 낮을수록 더 인지적 품질이 우수함
추론 시간 비교

Ablation Studies
SCATB 개수 변화 실험

개수 증가에 따라 성능 향상 → 5개 이상으로는 비슷한 성능 결과
모듈 소거 실험
PSNR, SSIM, FLOPs 결과

시각적 결과

- Effect of AFB : feature aggregation 과정에서 AFB 방식이 더 성능 향상에 기여함을 확인
- Effect of multi-scale or multi-level DWT : 2-level 2dDWT와 multi-scale 학습의 중요성
- Effect of CAB : w/o CAB = element wise 덧셈
- Effect of LHFIB : 주파수 정보 사용 시 더 우수하고 모델의 표현 능력을 향상시키기 위해 전역적 의존성을 제공함을 확인
LHFIB, CAB 유무로 에폭에 따른 로스 수렴 그래프

Full Model이 제일 빨리 수렴
LPIPS, BRISQUE, EPI
- BRISQUE ↓ : No-reference 화질 평가 지표로 낮을수록 우수
- EPI ↑ : Edge Preservation Index로 엣지 보존 정도를 의미

- LPIPS : w/o AFB (concat), w/o LHFIB 순으로 가장 큰 차이를 보임
- BRISQUE : DWT_L1, w/o AFB (concat) 순으로 가장 큰 차이를 보임
- EPI : w/o LHFIB, w/o AFB (Add) 순으로 가장 큰 차이를 보임
시각적 품질에서는 AFB, 엣지 보존에서는 LHFIB이 가장 큰 영향을 미치는 것을 확인할 수 있음
엣지 검출 결과
- 1행 : SIFT 방식으로 특징점 검출 결과
- 2행 : Canny 엣지 검출 결과

타 방법론들에 비해 많은 특징점 검출하고 다른 방법론들은 검출하지 못한 엣지 검출하는 우수함을 보임