[논문 리뷰] Super Resolution : (TTSR) Learning Texture Transformer Network for Image Super-Resolution

Soeun An·2025년 1월 29일

Paper Review

목록 보기
3/10

논문 이름 : Learning Texture Transformer Network for Image Super-Resolution (CVPR 2020)
원본 논문 : https://arxiv.org/pdf/2006.04139
소스 코드 : https://github.com/researchmm/TTSR?tab=readme-ov-file

키워드 : Reference based Super-resolution

요약 : HR 참조 이미지를 사용하는 SR

느낀 점 : 기존 SR과 다르게 HR 참조 이미지를 사용하여 SR 성능 향상함 모델 구조 개선뿐만 아니라 인풋에 다른 걸 추가하여 하는 방향으로 성능 향상 고려할 수 있음


Texture Transformer


backbone : LR
texture transfomer : LR↑(4× bicubic-upsampled input image), Ref, Ref↓↑ (4x bicubic down-sampling and up-sampling)

Learnable Texture Extractor (LTE)

RefSR에서는 ref 이미지에서 텍스처 추출이 중요
semantic feature 추출 대신 LTE에서 파라미터 학습으로 설계
LR, Ref 이미지 feature을 공동으로 학습해서 더 정확한 texture feature 캡처
사전학습된 VGG를 초기값으로 해서 파인튜닝 느낌으로 훈련됨

Relevance Embedding

Q,K 사이 유사성을 추정해서 LR과 Ref 이미 사이 관련성을 임베딩
Q, K를 patch로 펼치기
normalized inner product로 두 패치 사이의 relevance r 계산
r은 attention에서 사용

Hard Attention

HR texture features V를 transfer해서 T를 구함

기존 attention 방식으로 계산하면 transferring HR texture features 제한

=> V에서 qi와 관련성이 높은 feature들만 transfer

먼저 hard-attention map H에서 hi를 계산

hi는 V에서 qi와 관련성이 높은 이미지 위치 index == LR 이미지의 가장 관련성 있는 Ref 이미지 위치 index


T를 얻기 위해, V를 hard attention map 써서 T의 ti index selection 계산

T는 soft attention에서 사용

Soft attention

T와 F를 합성하기 위한 모듈

아까 H처럼 soft attention map인 S을 쓰는데 T의 각 위치에서 the confidence of the transferred texture features을 표현해주는 si를 계산

=> 합성 과정에서 관련 없는 것보다 더 관련 있는 텍스처 transfer를 향상시킴

LR 이미지 정보를 더 꺼내기 위해 다이렉트하게 S를 T에 적용하는 것이 아니라 먼저 T와 F을 fuse

fuse된 feature들은 element-wisely S에 곱해지고 F을 더해서 output 결정

element-wisely : 벡터에서 원소별로 연산


texture transformer은 Ref의 LR feature로부터 관련 있는 HR texture을 transfer을 효과적으로 할 수 있음

Cross-Scale Feature Integration


scale을 cross하여 TT을 쌓을 수 있음
x1, x2, x4 scale이 합성된 feature 출력

다른 scale 정보 배우면 더 나은 표현이 가능

CSFI 모듈은 지날 때마다 다음 스케일로 up sampling 되고 다른 스케일의 up/down sampling된 feature를 교환

마지막에 feature maps의 채널 수에 따라 컨벌루션 진행

Loss Function

  • Reconstruction loss

  • Adversarial loss


Generative adversarial networks (GAN)은 선명하고 좋은 이미지 생성함

  • Perceptual loss


타켓 이미지랑 예측 이미지를 feature space 유사성을 향상
첫번째 항은 traditional perceptual loss
두번째 항은 transferal perceptual loss
transferal perceptual loss 제한해서 SR 예측이 T와 비슷한 texture feature을 가지게 함

Implementation Details

LTE는 5개 컨벌루션 레이어, 2개 풀링 레이어로 이루어지고 3개의 scale texture features 추출
relevance embedding은 젤 작은 scale에서만 이루어지고 다른 scale에는 전파
discriminator은 BN을 제거한 SRNTT
훈련 데이터는 수평 수직으로 90, 180, 270도 뒤집힌 data을 써서 증가
min batch는 40 40 9개의 LR 패치 포함, HR과 Ref의 패치는 160 160 9개
2 에폭은 rec 로스만 적용하고 다음 에폭부터 모든 로스 적용 총 50 에폭

Experiments results


Ablation Studies

User study

소거 실험

Ref 관련도 실험

0개의 댓글