image fusion을 알아보고 frequecy domain을 직접적으로 변경하여 하는 Ref_SR을 본 적은 없는 것 같아 저 strucutre에서 아이디어을 얻어서 Ref_SR에 적용해보면 어떨까
https://github.com/lqz2/SFDFusion?tab=readme-ov-file
https://arxiv.org/pdf/2410.22837
Image fusion은 서로 다른 optical sensor에서 나온 여러가지 정보를 포함하는 이미지를 생성하기 위해 초점을 둔다. 분야로는 remote sensing, autonomous driving, medical imaging diagnosis등이 있다.
적외선, 가시광선 image fusion도 이러한 image fusion 중 하나의 분야이다.
적외선 이미지는 thermal radiation 정보를 포함하고 조명이 적을 때 가시광선 이미지보다 더 높은 대비를 보여 인식하기 더 쉬움
그러나 단점으로 texture detail이 가시광선 이미지보다 떨어짐
이러한 단점을 극복하기 위해 Infrared and visible image fusion을 도입하여 풍부한 텍스처와 대비 정보를 가진 융합 이미지를 생성할 수 있으며, 이를 통해 인간과 기계의 시각 인지 능력을 향상
적외선과 가시광 이미지 퓨전에서 가장 중요한 문제는 두 가지 모달리티(Modality)에서 유용한 정보를 효과적으로 추출하여 하나의 이미지로 합치는 것임
전통적인 방법으로는
1. Sparse Representation
2. Multi-Scale Transform
3. Subspace
4. hybrid models
이러한 방법들은 복잡한 퓨전 규칙과 수작업으로 특징을 추출해야 하므로 표현혁이 제한됨
딥러닝 기반 방법으로는
1. CNN
공간 도메인(Spatial Domain)에서 이미지를 퓨전
2. GAN
생성 모델을 활용해 더욱 자연스러운 퓨전 이미지를 생성
3. transformer
Self-Attention을 활용해 장거리(long-range) 의존성을 모델링하여 더 정교한 퓨전 수행
기존 딥러닝 기반 방법들 한계점
1️⃣ 대부분의 모델이 공간 도메인(Spatial Domain)에서만 특징을 추출하며, 주파수 도메인(Frequency Domain) 정보를 충분히 활용하지 못함.
2️⃣ 복잡한 네트워크 구조로 인해 실시간 처리(Real-time Processing)가 어려움.
3️⃣ 일부 연구들은 주파수 도메인 정보를 활용하지만, 공간 도메인과 독립적으로 처리하여 퓨전 성능이 최적화되지 않음
Motivation
기존 연구들은 공간 도메인(Spatial Domain) 또는 주파수 도메인(Frequency Domain) 중 하나에만 집중하는 경우가 많아 정보 손실이 발생함.
공간 도메인: 물체(Target)와 배경(Background)을 잘 구분할 수 있지만, 고주파 정보(텍스처, 경계선)는 부족할 수 있음.
주파수 도메인: 고주파 정보(High-Frequency Information) 및 반복적인 패턴(Repetitive Patterns)을 더 잘 분석할 수 있지만, 공간적 관계를 보존하는 데 한계가 있음.
이러한 문제를 해결하기 위해 연구진은 공간 도메인과 주파수 도메인을 병렬로 결합하는 모델이 필요하다 생각
Contributions
적외선 및 가시광 이미지 퓨전을 위한 효율적인 공간-주파수 도메인 퓨전(SFDFusion) 네트워크를 제안
📌 SFDFusion의 주요 특징:
본 논문의 SFDFusion 네트워크는 7가지 최신 딥러닝 기반 적외선-가시광 퓨전 기법과 비교하여 더 나은 퓨전 품질과 뛰어난 효율성을 보인다.
특히, 객체 탐지(Object Detection)와 같은 다운스트림(Downstream) 태스크에서도 성능 향상을 입증
Traditional Image Fusion
Deep Learning based Image Fusion
1️⃣ CNN(Convolutional Neural Network) 기반 방법
2️⃣ GAN(Generative Adversarial Network) 기반 방법
3️⃣ Transformer 기반 방법

먼저, 가시광선 이미지을 RGB color space에서 YCbCr color space로 변환하고 Y 채널 가시광선 이미지가 가시광선 이미지의 입력으로 들어감
적외선 이미지와 가시광선 이미지가 DMRM에 입력되어 서로 다른 모달리티에서 중요한 정보와 보완 정보를 강화하고 통합하여, (F_ir ∈ R^{D×H×W}) 및 (F_vis ∈ R^{D×H×W}) 출력을 얻음
FDFM에서 동일한 입력으로 들어가고 FFT로 이미지를 주파수 도메인으로 변환하고 진폭 맵끼리, 위상 맵끼리 채널 차원 concat함
그리고 conv block을 통과시키고 다시 spatial 도메인으로 전환해주기 위해 IFFT을 해줌
이전 출력들로부터 채널 차원에 따라 최대값과 평균값을 계산하고 concat과 conv을 통과하여 최종 FDFM 출력 F_fre을 얻음
세 가지 Feature을 채널 차원에서 concat하고 conv layer을 통과하여 최종 퓨전 이미지를 얻음
단일 modality일 경우 중요한 구조 정보, 배경 texture 정보가 부족함
더 높은 품질 fusion 이미지를 얻기 위해 DMRM으로 적외선, 가시광선 이미지를 refinement 하는 과정을 거침 이는 reconstruction으로 볼 수 있음
먼저, conv와 relu을 지나 차원을 확장함

각 모달리티에 세가지 branch을 구성하여 효과적으로 정보를 향상
1. texture information branch
2. attention branch
3. complementary information branch
Sobel Operator : 경계 및 텍스처 정보를 추출하는 filter


attention branch
불필요한 정보는 억제하기 위해 attention block을 활용
ATtention Block은 conv와 sigmoid을 통과하고 입력을 한 번 더 곱해줘서 얻음
complementary information branch
다른 모달리티에서 보완 정보를 adaptively 캡처할 수 있도록 목표
적외선 이미지와 가시광선 이미지를 원소합해서 ATB을 통과해 다른 모달리티의 상호 보완 정보를 분리하여 학습
마지막으로 각 branch에 나온 출력을 element wise sum하여 DMRM 최종 출력을 만듬

주파수 도메인 정보는 다른 관점에서 이미지의 숨겨진 feature을 찾을 수 있음
주파수 도메인에서는 고주파 정보를 검색하고 반복 패턴을 통해 edge와 texture 정보를 더 잘 식별하게 해줌
게다가, 주파수 도메인의 글로벌한 특징은 conv의 local한 부분에 부정적인 영향을 주는 걸 보완함
본 논문에서는 light weighted 모듈인 FDFM을 제안
먼저 적외선과 가시광선 이미지를 주파수 도메인을 변환해주기 위해 FFT함
각각 진폭 맵은 abs해주고 위상 맵은 element wise angle해줌

그리고 진폭끼리, 위상끼리 concat을 해줌
그리고 각각 conv와 LReLU을 통과하여 서로 다른 모달리티에서 효과적인 정보를 통합하고 캡처함
IFFT을 거쳐서 다시 spatial 도메인으로 역변환

주파수 도메인 브랜치 성능을 향상시키고 출력 차원을 늘리기 위해 최댓값과 평균값을 이전 출력의 채널 차원에서 계산
그 값을 concat하고 conv와 ReLU 블럭을 통과





주파수 도메인에서 융합하는 과정에 노이즈가 발생하거나 일부 픽셀 정보 손실할 수 있음
spatial 도메인과 주파수 도메인의 소스 이미지 간의 일관성을 유지하고 최대한 많은 보완 정보를 보존하게끔 함
IFFT 통과후 saliency을 적용하여 적외선 이미지의 두드러진 열 대상과 가시광선 이미지의 배경 세부 사항과의 상관 계수를 계산
mask는 전경을 의미하고 1 - mask는 배경을 의미함






