논문 이름 : Spatial and frequency information fusion transformer for image super-resolution (Neural Networks 2025)
원본 논문 : https://www.sciencedirect.com/science/article/abs/pii/S0893608025002308
소스 코드 : https://github.com/Xufujie/SFFT
키워드 : Super Resolution, Spatial and frequency information fusion
요약 : 주파수 도메인 정보 사용하여 SR, 기존 STL과 다른 attention 방식
느낀 점 : 주파수 정보가 가지는 특성에 대해 알고 OCAB을 사용하여 기존 STL보다 향상시킨 것이 인상적
Introduction
- CNN based SR
- residual learning, dense connections 등을 통해 CNN 기반 SR 복원 성능 향상
- CNN의 연산은 서로 다른 지역 부분에서 동일한 커널을 사용하는 것이 최적이 아니라는 한계 존재

-
Transformer based SR
- Transformer의 전역 의존성 모델링 능력으로 SR 성능 향상에 크게 기여
- 전역적 정보 학습 가능해졌지만, 대부분 non-overlapping 윈도우 self-attention을 사용하여 전역 정보 학습에 제약 존재

-
Frequency 요소 SR
- 기존 연구들은 거의 주파수 영역의 복원 성능을 고려하지 않음
- HR 이미지는 LR보다 공간적으로 세밀할 뿐 아니라 주파수 영역에서도 더 풍부한 스펙트럼을 가짐
- LR의 주요 주파수 성분은 6,000–11,000 Hz, HR은 27,000–39,000 Hz에 집중
- 고주파 성분의 학습이 SR 품질 향상에 중요함

Contributions
- 공간 및 주파수 정보를 결합해 상호보완적인 강점을 활용하여 복원 성능을 대폭 향상
- 공간 도메인 → 지역적(Local) 특징 포착, 주파수 도메인 → 전체적(Holistc) 특징 포착
- Residual Hybrid Swin Group (RHSG) 설계
- Swin Transformer Layer (STL), Overlapping Cross-Attention Block (OCAB), Dual Domain Convolution Block (DDCB)
- 다양한 벤치마크 실험에서 SFFT는 기존 최신 기법보다 우수한 성능을 달성
Overall Method

- Shallow Feature Extraction : 3×3 Conv 한 층으로 입력 LR 이미지를 고차원 공간으로 투영, 저주파 정보 보존
- Deep Feautre Extraction : K개의 RHSG, 3×3 Conv층으로 구성, CNN과 Transformer의 장점을 모두 결합하여 네트워크의 전반적인 성능을 향상
- Global Residual Path : 저주파 정보를 직접 복원 모듈로 전달, 얕은 특징, 깊은 특징을 효과적으로 결합
- Image Reconstruction : Conv와 Pixel Shuffle Layer을 사용하여 특징 맵을 고해상도 크기로 업샘플링
Method

- Transformer 구조로 다중 헤드 자기 어텐션(Multi-Head Self-Attention, MSA) 메커니즘
- 입력 특징 맵 : H x W x C 일 때, non-overlapping 윈도우 (M∗M)로 분할하여 윈도우 갯수 HW/M2
- 각 윈도우 내에서 독립적으로 self-attention 계산
- 윈도우 어텐션은 메모리 효율적이고 복잡도는 O(n) 달성
- 이 MSA와 MLP 앞단에 Layer Normalization이 적용, Residual Connection 포함
- 전역 모델링 능력을 향상시키기 위해, Shifted Window Self-Attention (SW-MSA)가 사용
- 윈도우 분할 전에 특징 맵을 가로·세로 방향으로 각각 M/2만큼 이동하여 인접 윈도우 간의 정보 교환이 가능
Overlapping Cross - Attention (OCAB)
-
기존 STL에 SW-MSA는 윈도우 간 상호작용이 어느 정도 가능하지만 간접적으로 이루어짐
-
공간 도메인의 일부를 직접 겹치도록 설계하여 윈도우 간의 직접적인 상호작용이 일어나도록 함
-
STL의 W-MSA을 OCA로 교체한 구조로 사용
-
Key, Value을 Query보다 약간 더 크고 겹치는 크기의 윈도우로 설정
-
Key가 더 넓은 이미지 영역 또는 더 많은 픽셀 위치를 포함한다는 것을 의미 더 넓은 컨텐츠 속에서 가장 관련성 높은 특징을 포착
-
Value 또한 더 많은 특징과 정보를 출력에 가중 합산할 수 있게 되어, 결과적으로 더 풍부하고 표현력 있는 결과 생성
-
기존 non-overlapping 윈도우 방식에서 한계였던 윈도우 간 정보 교환을 강화

- Key, Value을 Query보다 약간 더 크고 겹치는 크기의 윈도우로 설정
- Query : HW/M^2 개의 윈도우 (M x M) 생성
- Key, Value : HW/M^2 개의 윈도우 (M0 x M0) 생성
- σ : 겹치는 영역 비율 제어 파라미터
- 윈도우 크기와 겹치 비율의 곱을 짝수가 되게 설정하여 윈도우 정렬이 중앙에 될 수 있게 함
- 이러한 조건으로 Cross Attention의 균형을 유지하고 모델의 안정성을 높임

Dual Domain Convolution Block (DDCB)
- 두 브랜치를 병렬적으로 구성하여 공간 정보뿐만 아니라 주파수 정보 융합 및 활용
- Spatial branch : 공간 도메인에서 지역적 특징 포착
- Frequency branch : 주파수 도메인에서 전역적 특징 학습

- Spatial branch
- Conv, Leaky ReLU, Conv로 구성, residual connection을 통해 지역적 특징의 표현력을 강화
- Frequency branch
- Conv, Leaky ReLU을 통해 먼저 정제된 특징맵을 얻은 후, FFT을 적용하여 주파수 도메인으로 변환
- Conv, Leaky ReLU, Conv과 residual connection을 통과하여 long-range contextual information을 포착
- IFFT 적용 후, 1 x 1 Conv을 통해 채널 수를 절반 줄여 공간 브랜치와 결합할 수 있도록 함
- 두 브랜치 정보는 concat 후, 1 x 1 Conv 통과하여 공간-주파수 도메인 간의 복합 정보로 융합
- 두 브랜치의 특성 손실을 방지하기 위해, 각 브랜치에 동일한 가중치를 부여하여 각 도메인의 정보가 왜곡되지 않도록 함
Loss Function
- Low - level vision 분야에서는 L1, L2, adversarial Loss을 일반적으로 사용
- 일부 연구에서는 L1 loss보다 안정적인 Charbonnier Loss을 사용
- 하지만, 이러한 Loss들은 훈련 과정에서 주파수 정보를 고려하지 않음 ※ SAFMN (2023)
FFT Loss
Experiments
Train details
RHSG 개수 : 6
STL 개수 : 6
윈도우 크기 : 16
OCAB 겹침 비율 : 0.5
SFFT+ : Self-ensemble 버전
Self - ensemble : 테스트 단계에서 입력 이미지를 변형해 모델을 여러 번 실행한 뒤, 원래 입력 이미지로 되돌려 평균하는 방법
PSNR, SSIM Results

특히 Urban100은 고주파 엣지 구조가 많은 데이터셋이므로 SFFT의 frequency 기반 설계가 큰 강점을 보임
Visual Results

Ablation Studies
각 모듈 소거 실험

DDCB는 DI(Diffusion Index)를 가장 크게 향상 → 전역 정보 활용 범위 증가 → FFT의 전역적 정보 활용
OCAB는 SSIM 가장 크게 개선 → 윈도우 간 직접 교차로 구조적 복원 향상
Informative Pixel Contribution : 재구성에 기여하는 정보성 픽셀
Overlapping Ratio (α) 실험

겹침 비율이 증가해도 파라미터 수는 일정
연산량은 소폭 증가
FFT Loss 효과 유무 실험

L1 + FFT Loss 병행 시 PSNR 상승률이 더 크고 안정적
주파수 영역 손실을 병행하면 세밀한 디테일 복원 향상
LPIPS 결과 비교

LPIPS도 최소값 → 인간 시각 기반 지각 품질(perceptual quality) 향상 입증
LAM (Local Attribution Map) 시각화 결과

LAM(DI) 시각화에서는 SFFT가 SwinIR/HAT보다 더 넓은 픽셀 범위를 사용 → 더 넓은 전역적 재구성 영역 확보