논문 이름 : Infrared and visible image fusion network based on spatial-frequency domain cross-learning (Infrared Physics and Technology 2025)
원본 논문 : https://www.sciencedirect.com/science/article/abs/pii/S1350449525001471
소스 코드 : https://github.com/HaodeShi/SFCFusion
키워드 : Image Fusion, Frequency domain and Spatial domain cross learning
요약 : 주파수 도메인 정보와 cross하여 학습
느낀 점 : 기존 RefSR fusion 방식에서 좀 더 나은 방식이 될 수 있을까??
Introduction
- Image Fusion
- 여러 센서(적외선·가시광)가 포착한 정보를 통합하는 기술
- 단일 센서의 한계를 보완 → 더 정확하고 포괄적인 장면 이해 가능
- 의료 · 자율주행 · 군사정찰 · 원격탐사 등 다양한 응용 분야에 사용

- IR vs Visible 이미지의 장단점
-
Infrared (IR)
- 장점: 조명 변화에도 강인함, 야간/악조건에서도 강건술
- 단점: 텍스처·컬러 정보 부족
-
Visible (VIS)
- 장점: 풍부한 텍스처와 색상
- 단점: 조명 의존, 야간/안개 환경에서는 급격히 성능 저하

-
Fourier Transform
- 공간 도메인의 정보를 주파수 도메인으로 변환
- 고속 푸리에 변환(FFT)과 역고속 푸리에 변환(IFFT) 알고리즘을 통해 효율적으로 계산 가능
- 진폭(A), 위상(P) 성분으로 분리 가능

-
진폭 VS 위상
- Amplitude (A) : 밝기, 스타일 정보로 이미지의 시각적 질감 표현
- Phase (P) : 구조, 형태 정보로 객체의 구조 및 의미적 형태 유지
-
공간 도메인 VS 주파수 도메인
- 공간 도메인 : 지역적(local) 특징 학습 가능하므로 텍스처, 세부 구조 보존
- 주파수 도메인 : 전역(global) 특징 표현하므로 전체 패턴, 조명 정보 보존
❗ 공간 + 주파수 정보의 보완적 관계 활용하여 정보 손실을 최소화 및 성능 향상 가능

Contributions
✔ 두 도메인 간 Spatial–Frequency Cross-learning 구조 도입
✔ Frequency branch : 글로벌 정보 일관성 유지 Spatial branch : 로컬 텍스처 강화
✔ FSCGM (Frequency-spatial cross-guidance module) : 두 도메인 간 정보를 최적화
✔ SOTA보다 우수한 정성·정량 성능
Network architecture

- 입력 전처리 및 채널 구성
- 입력: IR (1×H×W), VIS (Y채널, 1×H×W)
- VIS: RGB → YCbCr 변환, Y만 사용 (텍스처/밝기 안정성)
- 각각 입력들은 1×1 Conv로 얕은 특징 추출
- Dual domain Learning Branch
- Spatial Branch : 특징맵을 concat하여 학습 → 지역/세부 텍스처 집중
- Frequency Branch : 특징맵을 FFT 적용 후, 진폭/ 위상 분해하여 각 요소끼리 concat하여 학습 → 전역/스타일·구조 분리 학습
- FSCGM + IFFT Loop
- 주파수 브랜치 출력을 IFFT하여 공간 도메인으로 복원
- 공간 브랜치 특징과 함께 FSCGM으로 투입
- 양방향 교차 학습 → 두 브랜치로 재주입 (iterative learning)
- Decoder & 최종 출력
- 정제된 Spatial + Frequency 특징 → Fusion Decoder 통과하여 최종 Fused Image 생성
Methods
Frequency Learning Branch (FLB)
- FFT를 통해 주파수 도메인으로 변환하여 진폭과 위상 성분으로 분해 → 스타일과 구조 정보를 분리해 독립적 학습
- 두 모달리티의 진폭·위상 정보를 채널 방향으로 결합 → 각각 독립적인 연산을 적용
- 3×3 Conv, LeakyReLU, Residual 연결
- Residual 연결 : 깊은 네트워크에서 기울기 소실 방지, 주파수 브랜치 안정성 및 수렴 향상
- 처리된 특징맵을 IFFT하여 공간 도메인으로 복원 → FSCGM에 입력

Spatial Learning Branch (SLB)
- IR과 VIS의 얕은 특징을 결합이 입력으로 SLB에 들어감
- 공간 도메인에서 지역 정보 + 다중 스케일 특징 학습 → MSEM (Multi-Scale Selection Enhancement Module) 제안
- MSEM (Multi-Scale Selection Enhancement Module)
- 다양한 스케일에서 적외선과 가시광 이미지의 특징 정보를 수집
- IR와 VIS 간의 정보 융합 과정으로 각 모달리티의 핵심 정보를 유지
- 서로 다른 촬영 조건이나 동적 변화에 직면했을 때 모델의 강건성을 높여주며, 일반화 능력을 향상

- 1×1 Conv : 채널 간 정보 교환
- 3개의 병렬 Dilated Conv : 다양한 receptive field 학습
- Strip Pooling : 전역 + 지역 컨텍스트 통합

Frequency-spatial cross-guidance module (FSCGM)

- 공간과 주파수 도메인을 단순 합산하면 ❗semantic gap · 중복 정보 → 성능 저하
✔ 서로의 장점을 보완
✔ 불필요한 정보 제거
✔ fusion에 필요한 핵심 특징만 강화
- “주파수 → 공간” / “공간 → 주파수” 양방향 가이드
두 브랜치 간의 융합성을 향상, 중복 정보를 줄이면서 융합에 필요한 핵심 정보에 집중하도록 설계
- S_in : 주파수 도메인의 안내를 받아, 주파수 도메인에서 뚜렷한 전역·문맥 정보를 학습
- F_in : 공간 특징의 안내를 받아, 주파수 도메인에서 직접 포착하기 어려운 세부 텍스처를 학습
- 여러 단계의 상호 교차 학습 후, 특징을 채널 결합하여 네 개의 합성곱 층으로 구성된 디코더에 입력하고, 최종 융합 이미지를 생성
Loss functions
- Image Fusion Loss : 서로 다른 모달리티의 정보 비율을 결정하고 융합 이미지의 품질에 직접적인 영향을 줌
- Content Loss → 정보 보존 및 대비/디테일 강화 / SSIM Loss → 시각적 품질, 구조적 일관성 보장
- Pixel Intensity Loss : 강한 밝기·열영역인 고대비 영역 보존
- Gradient Loss : 경계, 텍스처, 에지 선명도 보존
- 두 loss의 비율은 α, β로 조절
- SSIM Loss
- 밝기 + 대비 + 구조 반영한 품질 평가
- 한쪽으로 치우친 융합을 방지하고 균형 잡힌 융합을 유도

Experiments
Implementation details
NVIDIA GeForce RTX 2080Ti GPU
배치 크기 : 4
α와 β : 기존 경험에 기반하여 각각 5와 10
입력 이미지를 320×320
Results
EN (Entropy) : 정보량 / 디테일 수준
MI (Mutual Information) : 소스 영상과의 정보 공유량
SF (Spatial Frequency) : 텍스처·에지의 변화량
SD (Standard Deviation) : 명암 대비, 선명도
VIF (Visual Information Fidelity) : 인간 시각 기반 정보 충실도
Qabf : 엣지 기반 융합 성능



CDF results
- 테스트 세트 전체 이미지에 대해 SFCFusion의 정량적 성능을 누적 분포(CDF) 그래프로 나타낸 것
- 곡선상의 한 점 (x, y)는 전체 이미지 쌍 중 (100×x)%의 샘플의 지표 값이 y 이하임을 의미

모델 복잡도 분석
SFDFusion보다 Size 좀 더 크지만 타 모델 성능 대비 사이즈와 FLOPs가 낮음

모듈 소거 실험

객체 탐지 결과

각 모듈 반복 횟수
반복 횟수가 증가함에 따라 모델의 성능이 상당히 향상되는 것을 확인
성능과 연산 효율 간의 균형을 고려하여 반복 횟수 N을 기본값 3
