[논문리뷰] Masking Strategies for Background Bias Removal in Computer Vision Models

Woosci·2026년 2월 10일

[논문리뷰]

목록 보기
14/14


😷 Masking Strategies for Background Bias Removal in Computer Vision Models

🔗 논문: https://arxiv.org/abs/2308.12127

💻 GitHub : Masking Strategies for Background Bias Removal in Computer Vision Models



✏️ 논문 정리

1. 이 논문을 읽는 이유가 무엇인가요?

⇒ 최근 Visual Prompting에 대해 살펴보다가 중요하지 않은 정보는 검정색으로 마스킹했을 때 성능이 향상되는 것을 관측할 수 있었다. 왜 이런 현상이 일어났는지 조금 더 이해하고자 관련 논문을 찾아보다가 이번 논문을 찾게 되었다.

2. 논문 제목의 의미는 무엇인가요?

⇒ Computer Vision Model이 가지고 있는 Background Bias를 제거하기 위해 Masking 전략을 사용했다는 의미이다.

3. 논문의 등장배경은 무엇인가요?

⇒ Computer Vision 모델은 학습 과정에서 이미지 속 물체 외에도 배경의 내용까지 함께 학습한다는 문제가 있다. 이런 Bias는 모델이 학습하고자 하는 물체만 정확하게 이해하는 것을 막는다는 문제점이 있어 이번 논문에서 이를 해결하고자 하였다.

4. 논문을 1~2줄로 요약한다면?

⇒ 논문은 입력 이미지의 물체를 제외한 배경은 모두 검정색으로 masking하여 모델의 Background Bias를 제거하고자 하였다. Masking 방법은 입력 데이터에 Masking을 적용하는 Early Masking 기법이 가장 성능이 좋았으며, 모델 학습을 진행할 때도 masking을 적용하면 더 좋은 성능을 발휘한다.



0️⃣ Basic Concept

🔷 Fine grained image classification

  • 조금 더 세밀한 Classification Task를 의미한다.

  • 예시: 비슷하게 생긴 새들의 종 분류하기

  • 이미지 속 오른쪽이 fine grained image classification에 해당한다.


🔷 Background Bias

  • CV 모델이 이미지를 학습할 때, 이미지 속 물체만 학습하는 것이 아니라 물체 외 배경까지 함께 학습하는 현상을 의미한다.

  • Background Bias가 심할 경우, 이미지에서 물체를 crop하더라도 모델이 물체가 무엇인지 예측할 수 있다.


🔷 Masking

  • 이미지에서 특정 부분을 가리거나, 지워서 모델이 볼 수 없도록 하는 것이다.

  • 이미지 픽셀 값을 0으로 만들어버린다고 이해하면 된다.



1️⃣ Problem Definition

🔷 Background Bias

When training deep learning based computer vision models on any object-centric task, it is extremely challenging to ensure that the model does indeed only pay attention to the object of interest, since there exist often strong correlations between object characteristics and the background

CV 모델이 이미지 데이터를 통해 학습할 때, 우리가 원하는 대상과 배경을 구분하여 정확히 대상에 집중하여 학습하는 것은 어렵다. 예를 들어 참새 사진과 “참새”라는 말을 함께 학습한다면 모델은 참새 뿐만 아니라 사진 속 나무나 구름 등 배경까지 함께 참새로 학습할 것이다. 이러한 문제는 새의 종 구분과 같이 비슷한 배경 속에서 객체의 디테일한 차이를 통해 구분해야 하는 fine grained Task에서 성능 저하가 발생할 수 있다.



2️⃣ Method

🔷 Masking

The standard way to address this type of bias is to make the model detect the foreground and focus on it for classification, both when using Convolutional Neural Networks [20] and Transformers [14]. This reduces the influence of the background on the model’s decision, thus reducing the background-induced bias of the model.

Background Bias를 제거하기 위해서 생각해볼 수 있는 가장 일반적인 방법은 사진 속에서 배경을 지워버리는 것이다. 논문에서는 이미지 속 객체를 제외한 나머지 영역마스킹함으로써 CV 모델이 가지고 있는 Background Bias를 제거하고자 하였다.

🔻 Early masking

Apply background masking at the image level using foreground-background (FG-BG) masks.

Early masking은 모델 입력 전 이미지마스킹을 적용하는 방식이다. Figure 2의 왼쪽 사진을 보면 배경 부분인 검정색으로 마스킹 된 것을 확인할 수 있다.

🔻 Late masking

Mask out high-level representations that spatially correspond to background regions at an intermediate stage of an image classification model using the FG-BG masks.

Late masking은 CV 모델 속에서 처리된 feature mapmasking을 적용하는 방법이다. Figure 2의 오른쪽 사진을 보면 feature map에 Resize된 mask가 적용되는 것을 확인할 수 있다.


🔷 Fine tuning

논문에서는 이미지에 각 마스킹을 적용한 후 CV 모델에게 fine tuning을 진행하였다. CV 모델이 Background Bias 없이 이미지 속 객체를 학습할 수 있도록 한 것이다. 학습 모델은 CNN 계열의 ConvNeXt 모델과 Vision Transformer이다.


🤔 그렇다면 어떤 방법이 더 좋을 것 같다고 생각하시나요?? 3초 정도만 생각해보세요!



3️⃣ Experiment

🔷 Dataset

  • CUB : 200 종의 새 이미지로 구성된 데이터셋이다. 학습 데이터로 5,994장의 이미지가 포함되어 있다.

  • Waterbird : CUB에서 배경만 다른 지역으로 바꾼 데이터셋이다.


🔷 Table 4

🔻 내용

  • Baseline : Masking 처리 없이 원본 CUB 데이터로 파인튜닝한 모델

  • Frozen : CUB 데이터셋 분류를 위해 마지막 레이어만 파인튜닝된 모델

  • Fine tuning : 전체 레이어가 학습된 모델

🔻 해석

  • ConvNeXt-B의 Baseline을 보면 모델이 배경만 바뀐 Waterbird 데이터셋에서 89.62 → 76.2성능이 하락하는 것을 확인할 수 있다. 이는 모델이 이미지 속 새를 학습할 때 배경까지 함께 새로 인식하여 판단하는 Background Bias가 있음을 의미한다.

  • ConvNeXt-B에 Early masking을 적용한 파인튜닝을 진행하였을 경우, 일반 파인튜닝 방식에 비해 76.2 → 87.01성능 향상이 있음을 확인할 수 있다.

  • 또한 Early masking 방식과 Late masking 방식을 비교하였을 경우 Early masking 방식이 Backgound Bias를 더 효과적으로 제거하는 것을 확인할 수 있다.



4️⃣ My thought

연구를 하는 과정에서 모델이 원하는 대상에만 집중했으면 좋겠다는 마음에 Masking을 적용하였다. 경험적으로 masking을 적용하는 방식이 효과가 있다는 것은 알았지만 그 원리에 대한 이해는 부족하였다. 이번 논문이 그에 대한 정확한 답변은 아니지만, Detection 모델에서 주요한 문제인 Background Bias 문제에 대해 정리할 수 있어서 좋았다. IPIU에서 알게 된 ‘모델마다 가지고 있는 Bias가 있다’는 사실의 좋은 사례였던 것 같아서 더욱 인상깊은 논문이었다. 이번 글에서는 주요하게 다루지는 않았지만, 본 논문에는 Vision Transformer와 CNN 모델의 Inductive Bias에 대해서도 다루고 있다. CV 모델에 관심이 있으신 분들은 논문이 길지 않으니 한번 읽어보는 것을 추천한다.

profile
I'm curious about AI

0개의 댓글