[논문 리뷰] Image Fusion : Infrared and visible image fusion network based on spatial-frequency domain cross-learning

Soeun An·2025년 12월 20일

Paper Review

목록 보기
10/10

논문 이름 : Infrared and visible image fusion network based on spatial-frequency domain cross-learning (Infrared Physics and Technology 2025)
원본 논문 : https://www.sciencedirect.com/science/article/abs/pii/S1350449525001471
소스 코드 : https://github.com/HaodeShi/SFCFusion

키워드 : Image Fusion, Frequency domain and Spatial domain cross learning

요약 : 주파수 도메인 정보와 cross하여 학습

느낀 점 : 기존 RefSR fusion 방식에서 좀 더 나은 방식이 될 수 있을까??


Introduction

  • Image Fusion
    • 여러 센서(적외선·가시광)가 포착한 정보를 통합하는 기술
    • 단일 센서의 한계를 보완 → 더 정확하고 포괄적인 장면 이해 가능
    • 의료 · 자율주행 · 군사정찰 · 원격탐사 등 다양한 응용 분야에 사용
  • IR vs Visible 이미지의 장단점
  • Infrared (IR)

    • 장점: 조명 변화에도 강인함, 야간/악조건에서도 강건술
    • 단점: 텍스처·컬러 정보 부족
  • Visible (VIS)

    • 장점: 풍부한 텍스처와 색상
    • 단점: 조명 의존, 야간/안개 환경에서는 급격히 성능 저하
  • Fourier Transform

    • 공간 도메인의 정보를 주파수 도메인으로 변환 
    • 고속 푸리에 변환(FFT)과 역고속 푸리에 변환(IFFT) 알고리즘을 통해 효율적으로 계산 가능
    • 진폭(A), 위상(P) 성분으로 분리 가능


  • 진폭 VS 위상

    • Amplitude (A) : 밝기, 스타일 정보로 이미지의 시각적 질감 표현
    • Phase (P) :  구조, 형태 정보로 객체의 구조 및 의미적 형태 유지 
  • 공간 도메인 VS 주파수 도메인

    • 공간 도메인 : 지역적(local) 특징 학습 가능하므로 텍스처, 세부 구조 보존
    • 주파수 도메인 : 전역(global) 특징 표현하므로 전체 패턴, 조명 정보 보존

❗ 공간 + 주파수 정보의 보완적 관계 활용하여 정보 손실을 최소화 및 성능 향상 가능

Contributions

✔ 두 도메인 간 Spatial–Frequency Cross-learning 구조 도입
✔ Frequency branch : 글로벌 정보 일관성 유지 Spatial branch : 로컬 텍스처 강화
✔ FSCGM (Frequency-spatial cross-guidance module) : 두 도메인 간 정보를 최적화
✔ SOTA보다 우수한 정성·정량 성능

Network architecture

  • 입력 전처리 및 채널 구성
    • 입력: IR (1×H×W), VIS (Y채널, 1×H×W)
    • VIS: RGB → YCbCr 변환, Y만 사용 (텍스처/밝기 안정성)
    • 각각 입력들은 1×1 Conv로 얕은 특징 추출

  • Dual domain Learning Branch
    • Spatial Branch : 특징맵을 concat하여 학습 → 지역/세부 텍스처 집중
    • Frequency Branch : 특징맵을 FFT 적용 후, 진폭/ 위상 분해하여 각 요소끼리 concat하여 학습 → 전역/스타일·구조 분리 학습

  • FSCGM + IFFT Loop
    • 주파수 브랜치 출력을 IFFT하여 공간 도메인으로 복원
    • 공간 브랜치 특징과 함께 FSCGM으로 투입
    • 양방향 교차 학습 → 두 브랜치로 재주입 (iterative learning)

  • Decoder & 최종 출력
    • 정제된 Spatial + Frequency 특징 → Fusion Decoder 통과하여 최종 Fused Image 생성

Methods

Frequency Learning Branch (FLB)

  • FFT를 통해  주파수 도메인으로 변환하여 진폭과 위상 성분으로 분해 → 스타일과 구조 정보를 분리해 독립적 학습
  • 두 모달리티의 진폭·위상 정보를 채널 방향으로 결합 →  각각 독립적인 연산을 적용
    • 3×3 Conv, LeakyReLU, Residual 연결
    • Residual 연결 : 깊은 네트워크에서 기울기 소실 방지, 주파수 브랜치 안정성 및 수렴 향상
  • 처리된 특징맵을 IFFT하여 공간 도메인으로 복원 → FSCGM에 입력

Spatial Learning Branch (SLB)

  • IR과 VIS의 얕은 특징을 결합이 입력으로 SLB에 들어감
  • 공간 도메인에서 지역 정보 + 다중 스케일 특징 학습 → MSEM (Multi-Scale Selection Enhancement Module) 제안

  • MSEM (Multi-Scale Selection Enhancement Module)
    • 다양한 스케일에서 적외선과 가시광 이미지의 특징 정보를 수집
    • IR와 VIS 간의 정보 융합 과정으로 각 모달리티의 핵심 정보를 유지
    • 서로 다른 촬영 조건이나 동적 변화에 직면했을 때 모델의 강건성을 높여주며, 일반화 능력을 향상

  • 1×1 Conv : 채널 간 정보 교환
  • 3개의 병렬 Dilated Conv : 다양한 receptive field 학습
  • Strip Pooling : 전역 + 지역 컨텍스트 통합
  • Dilated Conv (rate 2) 

    • 연산 복잡도를 늘리지 않고 수용 영역를 효과적으로 확장
  • Strip pooling

    • 각 열과 행에 대해 평균을 하여 H 1, 1 W strip pool 생성
    • 커널 3인 1D conv을 통과하여 주변 인접 특징을 학습
    • broadcast을 통해 H * W로 특징맵 확장
    • 각 요소를 더하여 fusion
    • 1x1 conv, sigmoid, residual connection을 통해 최종 출력 텐서 생성
  • context requirement coefficients

    • 다양한 특징의 컨텍스트 요구 계수를 종합적으로 고려하여 더욱 차별화된 컨텍스트를 형성하도록 설계
    • 모든 특징맵을 concat한 후, 1×1 Conv, ReLU, Sigmoid을 차례로 통과하여 계수 w 생성
    • 각 특징맵에 w을 곱한 다음 모든 특징맵을 합하여 최종 MSEB 출력물 생성

Frequency-spatial cross-guidance module (FSCGM)

  • 공간과 주파수 도메인을 단순 합산하면 ❗semantic gap · 중복 정보 → 성능 저하

✔ 서로의 장점을 보완
✔ 불필요한 정보 제거
✔ fusion에 필요한 핵심 특징만 강화

  • “주파수 → 공간” / “공간 → 주파수” 양방향 가이드
    두 브랜치 간의 융합성을 향상, 중복 정보를 줄이면서 융합에 필요한 핵심 정보에 집중하도록 설계
  • 공간 입력 S_in

    • M_s : 공간 변조 지도 → F_in에 곱해 공간 차원 modulation
    • C_s : S_F''에 곱해 채널 차원 modulation
  • 공간 입력 F_in

    • M_F: 공간 변조 지도 → S_in에 곱해 공간 차원 modulation
    • C_F : F_S''에 곱해 채널 차원 modulation

  • S_in 입력

    • 3×3 Conv, LeakyReLU, Residual 연결, Sigmoid → M_s 생성
    • 3×3 Conv, LeakyReLU, Residual 연결, Global Average Pooling, Fully Connected → C_s 생성
  • M_s와 F_in 곱 → S_F' → S_F'와 C_s와 곱 → S_F'' 

  • 최종적으로 입력 S_in과 S_F" concat하여 S_out 생성


  • S_in : 주파수 도메인의 안내를 받아,  주파수 도메인에서 뚜렷한 전역·문맥 정보를 학습
  • F_in : 공간 특징의 안내를 받아, 주파수 도메인에서 직접 포착하기 어려운 세부 텍스처를 학습
  • 여러 단계의 상호 교차 학습 후, 특징을 채널 결합하여 네 개의 합성곱 층으로 구성된 디코더에 입력하고, 최종 융합 이미지를 생성

Loss functions

  • Image Fusion Loss : 서로 다른 모달리티의 정보 비율을 결정하고 융합 이미지의 품질에 직접적인 영향을 줌 
  • Content Loss → 정보 보존 및 대비/디테일 강화 / SSIM Loss → 시각적 품질, 구조적 일관성 보장
    • Pixel Intensity Loss : 강한 밝기·열영역인 고대비 영역 보존
    • Gradient Loss : 경계, 텍스처, 에지 선명도 보존
    • 두 loss의 비율은 α, β로 조절
  • SSIM Loss
    • 밝기 + 대비 + 구조 반영한 품질 평가
    • 한쪽으로 치우친 융합을 방지하고 균형 잡힌 융합을 유도

Experiments 

Implementation details

NVIDIA GeForce RTX 2080Ti GPU
배치 크기 : 4
α와 β : 기존 경험에 기반하여 각각 5와 10
입력 이미지를 320×320

Results

EN (Entropy) : 정보량 / 디테일 수준
MI (Mutual Information) : 소스 영상과의 정보 공유량
SF (Spatial Frequency) : 텍스처·에지의 변화량
SD (Standard Deviation) : 명암 대비, 선명도
VIF (Visual Information Fidelity) : 인간 시각 기반 정보 충실도
Qabf : 엣지 기반 융합 성능

CDF results

  • 테스트 세트 전체 이미지에 대해 SFCFusion의 정량적 성능을 누적 분포(CDF) 그래프로 나타낸 것
  • 곡선상의 한 점 (x, y)는 전체 이미지 쌍 중 (100×x)%의 샘플의 지표 값이 y 이하임을 의미

모델 복잡도 분석

SFDFusion보다 Size 좀 더 크지만 타 모델 성능 대비 사이즈와 FLOPs가 낮음

모듈 소거 실험

객체 탐지 결과

각 모듈 반복 횟수

반복 횟수가 증가함에 따라 모델의 성능이 상당히 향상되는 것을 확인
성능과 연산 효율 간의 균형을 고려하여 반복 횟수 N을 기본값 3

0개의 댓글