[논문 리뷰] Image Fusion : SFDFusion: An Efficient Spatial-Frequency Domain Fusion Network for Infrared and Visible Image Fusion

Soeun An·2025년 2월 13일

Paper Review

목록 보기
5/10

image fusion을 알아보고 frequecy domain을 직접적으로 변경하여 하는 Ref_SR을 본 적은 없는 것 같아 저 strucutre에서 아이디어을 얻어서 Ref_SR에 적용해보면 어떨까

https://github.com/lqz2/SFDFusion?tab=readme-ov-file
https://arxiv.org/pdf/2410.22837


1. Introduction

Image fusion은 서로 다른 optical sensor에서 나온 여러가지 정보를 포함하는 이미지를 생성하기 위해 초점을 둔다. 분야로는 remote sensing, autonomous driving, medical imaging diagnosis등이 있다.

적외선, 가시광선 image fusion도 이러한 image fusion 중 하나의 분야이다.

적외선 이미지는 thermal radiation 정보를 포함하고 조명이 적을 때 가시광선 이미지보다 더 높은 대비를 보여 인식하기 더 쉬움
그러나 단점으로 texture detail이 가시광선 이미지보다 떨어짐

이러한 단점을 극복하기 위해 Infrared and visible image fusion을 도입하여 풍부한 텍스처와 대비 정보를 가진 융합 이미지를 생성할 수 있으며, 이를 통해 인간과 기계의 시각 인지 능력을 향상

적외선과 가시광 이미지 퓨전에서 가장 중요한 문제는 두 가지 모달리티(Modality)에서 유용한 정보를 효과적으로 추출하여 하나의 이미지로 합치는 것임

전통적인 방법으로는
1. Sparse Representation
2. Multi-Scale Transform
3. Subspace
4. hybrid models

이러한 방법들은 복잡한 퓨전 규칙과 수작업으로 특징을 추출해야 하므로 표현혁이 제한됨

딥러닝 기반 방법으로는
1. CNN
공간 도메인(Spatial Domain)에서 이미지를 퓨전
2. GAN
생성 모델을 활용해 더욱 자연스러운 퓨전 이미지를 생성
3. transformer
Self-Attention을 활용해 장거리(long-range) 의존성을 모델링하여 더 정교한 퓨전 수행

기존 딥러닝 기반 방법들 한계점
1️⃣ 대부분의 모델이 공간 도메인(Spatial Domain)에서만 특징을 추출하며, 주파수 도메인(Frequency Domain) 정보를 충분히 활용하지 못함.
2️⃣ 복잡한 네트워크 구조로 인해 실시간 처리(Real-time Processing)가 어려움.
3️⃣ 일부 연구들은 주파수 도메인 정보를 활용하지만, 공간 도메인과 독립적으로 처리하여 퓨전 성능이 최적화되지 않음

  • Motivation
    기존 연구들은 공간 도메인(Spatial Domain) 또는 주파수 도메인(Frequency Domain) 중 하나에만 집중하는 경우가 많아 정보 손실이 발생함.
    공간 도메인: 물체(Target)와 배경(Background)을 잘 구분할 수 있지만, 고주파 정보(텍스처, 경계선)는 부족할 수 있음.
    주파수 도메인: 고주파 정보(High-Frequency Information) 및 반복적인 패턴(Repetitive Patterns)을 더 잘 분석할 수 있지만, 공간적 관계를 보존하는 데 한계가 있음.
    이러한 문제를 해결하기 위해 연구진은 공간 도메인과 주파수 도메인을 병렬로 결합하는 모델이 필요하다 생각

  • Contributions
    적외선 및 가시광 이미지 퓨전을 위한 효율적인 공간-주파수 도메인 퓨전(SFDFusion) 네트워크를 제안

📌 SFDFusion의 주요 특징:

  1. 공간 도메인과 주파수 도메인을 동시에 활용하는 병렬 구조(Parallel Structure) 설계
    기존의 직렬(Serial) 접근 방식이 아닌 병렬 방식으로 두 도메인의 정보를 통합하여 정보 손실을 최소화함.
  2. Dual-Modality Refinement Module (DMRM) 설계
    공간 도메인에서 보완적인 정보를 효과적으로 추출하여 불필요한 정보를 제거하고, 중요한 세부 정보를 강조함.
  3. Frequency Domain Fusion Module (FDFM) 설계
    Fast Fourier Transform (FFT) 및 Inverse FFT (IFFT)를 활용하여 주파수 도메인에서 정보를 추출하고 융합.
  4. 주파수 도메인 퓨전 손실(Frequency Domain Fusion Loss) 도입
    주파수 도메인에서의 퓨전 품질을 개선하고, 공간 도메인과 일관성을 유지하도록 설계.

본 논문의 SFDFusion 네트워크는 7가지 최신 딥러닝 기반 적외선-가시광 퓨전 기법과 비교하여 더 나은 퓨전 품질과 뛰어난 효율성을 보인다.
특히, 객체 탐지(Object Detection)와 같은 다운스트림(Downstream) 태스크에서도 성능 향상을 입증

  1. Traditional Image Fusion

  2. Deep Learning based Image Fusion
    1️⃣ CNN(Convolutional Neural Network) 기반 방법

  • CNN은 이미지의 특징을 자동으로 학습하고, 이를 통해 퓨전 이미지를 생성하는 방법이다【18, 19】.
  • DenseNet과 같은 고급 CNN 구조를 활용하여, 보다 정교한 퓨전 결과를 얻을 수 있음【9】.
    💡 장점: 수동적인 특징 추출 없이 자동으로 퓨전 가능.
    ❌ 단점: 공간 도메인(Spatial Domain)에 초점이 맞춰져 있으며, 주파수 도메인 정보는 활용하지 않음.

2️⃣ GAN(Generative Adversarial Network) 기반 방법

  • 적대적 생성 신경망(GAN)을 활용하여 자연스럽고 높은 품질의 퓨전 이미지를 생성하는 방식【23, 29】.
  • 일부 연구에서는 듀얼 디스크리미네이터(Dual Discriminator) 구조를 활용하여 더욱 정교한 퓨전 결과를 생성【24】.
    💡 장점: 퓨전 이미지의 품질이 높고 자연스러움.
    ❌ 단점: 학습 과정이 불안정할 수 있으며, 훈련 데이터가 많이 필요함.

3️⃣ Transformer 기반 방법

  • 최근 Transformer 모델이 이미지의 장거리(long-range) 의존성을 학습하는 데 강점을 보이며, 이미지 퓨전에도 활용됨【36, 46】.
  • Self-Attention Mechanism을 활용하여 원본 이미지의 중요한 정보를 더욱 효과적으로 보존할 수 있음.
    💡 장점: 이미지 전체의 정보를 효과적으로 학습 가능.
    ❌ 단점: 계산량이 많고 실시간 처리에 어려움이 있음.

3. Methods

3.1 Overall Framework

먼저, 가시광선 이미지을 RGB color space에서 YCbCr color space로 변환하고 Y 채널 가시광선 이미지가 가시광선 이미지의 입력으로 들어감

적외선 이미지와 가시광선 이미지가 DMRM에 입력되어 서로 다른 모달리티에서 중요한 정보와 보완 정보를 강화하고 통합하여, (F_ir ∈ R^{D×H×W}) 및 (F_vis ∈ R^{D×H×W}) 출력을 얻음

FDFM에서 동일한 입력으로 들어가고 FFT로 이미지를 주파수 도메인으로 변환하고 진폭 맵끼리, 위상 맵끼리 채널 차원 concat함
그리고 conv block을 통과시키고 다시 spatial 도메인으로 전환해주기 위해 IFFT을 해줌
이전 출력들로부터 채널 차원에 따라 최대값과 평균값을 계산하고 concat과 conv을 통과하여 최종 FDFM 출력 F_fre을 얻음

세 가지 Feature을 채널 차원에서 concat하고 conv layer을 통과하여 최종 퓨전 이미지를 얻음

3.2 Dual-Modality Refinement Module (DMRM)

단일 modality일 경우 중요한 구조 정보, 배경 texture 정보가 부족함
더 높은 품질 fusion 이미지를 얻기 위해 DMRM으로 적외선, 가시광선 이미지를 refinement 하는 과정을 거침 이는 reconstruction으로 볼 수 있음

먼저, conv와 relu을 지나 차원을 확장함

각 모달리티에 세가지 branch을 구성하여 효과적으로 정보를 향상
1. texture information branch
2. attention branch
3. complementary information branch

  1. texture information branch
    Gradient Extraction Blocks (GEB)을 통해 gradient information을 추출
    GEB는 sobel 연산자를 사용하여 X 및 Y 방향으로 이미지를 conv한 다음 각 방향의 그래디언트 정보를 abs로 변환하여 합산

Sobel Operator : 경계 및 텍스처 정보를 추출하는 filter

  1. attention branch
    불필요한 정보는 억제하기 위해 attention block을 활용
    ATtention Block은 conv와 sigmoid을 통과하고 입력을 한 번 더 곱해줘서 얻음

  2. complementary information branch
    다른 모달리티에서 보완 정보를 adaptively 캡처할 수 있도록 목표
    적외선 이미지와 가시광선 이미지를 원소합해서 ATB을 통과해 다른 모달리티의 상호 보완 정보를 분리하여 학습

마지막으로 각 branch에 나온 출력을 element wise sum하여 DMRM 최종 출력을 만듬

3.3 Frequency Domain Fusion Module (FDFM)

주파수 도메인 정보는 다른 관점에서 이미지의 숨겨진 feature을 찾을 수 있음
주파수 도메인에서는 고주파 정보를 검색하고 반복 패턴을 통해 edge와 texture 정보를 더 잘 식별하게 해줌
게다가, 주파수 도메인의 글로벌한 특징은 conv의 local한 부분에 부정적인 영향을 주는 걸 보완함

본 논문에서는 light weighted 모듈인 FDFM을 제안

먼저 적외선과 가시광선 이미지를 주파수 도메인을 변환해주기 위해 FFT함
각각 진폭 맵은 abs해주고 위상 맵은 element wise angle해줌

그리고 진폭끼리, 위상끼리 concat을 해줌
그리고 각각 conv와 LReLU을 통과하여 서로 다른 모달리티에서 효과적인 정보를 통합하고 캡처함

IFFT을 거쳐서 다시 spatial 도메인으로 역변환

주파수 도메인 브랜치 성능을 향상시키고 출력 차원을 늘리기 위해 최댓값과 평균값을 이전 출력의 채널 차원에서 계산
그 값을 concat하고 conv와 ReLU 블럭을 통과

3.4 Losss Function

  1. Content Loss
    대비 정보와 texture detalis을 향상하기 위해 픽셀 강도 loss와 gradient loss을 사용


  1. SSIM Loss
    SSIM은 이미지의 품질을 밝기, 대비 및 구조 측면에서 포괄적으로 평가합니다.구조적 유사성 지수 손실을 고려

  1. Saliency Target Loss
    선명한 목표 정보를 추출하고, 가시적 이미지의 질감 정보를 효과적으로 얻기 위해 STDFusion의 방법을 참조
    적외신 이미지에서 saliency mask을 생성하고 이 마스크와 퓨전 이미지에서 마스크 차이가 작아지게 해줌

  1. Frequency Domain Fusion Loss

주파수 도메인에서 융합하는 과정에 노이즈가 발생하거나 일부 픽셀 정보 손실할 수 있음
spatial 도메인과 주파수 도메인의 소스 이미지 간의 일관성을 유지하고 최대한 많은 보완 정보를 보존하게끔 함
IFFT 통과후 saliency을 적용하여 적외선 이미지의 두드러진 열 대상과 가시광선 이미지의 배경 세부 사항과의 상관 계수를 계산
mask는 전경을 의미하고 1 - mask는 배경을 의미함

Experiments

Results

모델 효율성 비교

객체 탐지 결과

Ablation Study

모듈 소거 실험

0개의 댓글