CDN4 논문 리뷰

김준형·2025년 8월 27일

딥러닝 논문 리뷰

목록 보기
17/33

ABSTRACT
fine-grained few-shot 분류는 컴퓨터 비전에서 도전적인 과제로, 적은 수의 라벨링된 샘플만 주어진 상황에서 미묘하고 세부적인 차이를 지닌 이미지를 분류하는 것을 목표로 한다. 이 과제를 해결하기 위한 유망한 접근법 중 하나는 공간적으로 지역 특징을 활용하여 query 샘플과 support 샘플 간의 유사성을 조밀하게 측정하는 것이다. 이미지 수준의 전역 특징과 비교할 때, 지역 특징은 더 풍부한 저수준 정보를 포함하고 있으며, 새로운 범주에 전이 가능성이 높다. 그러나 공간적으로 지역화된 특징에 기반한 방법들은 샘플 다양성의 부족으로 인해 세부적인 범주 차이를 구분하는 데 어려움을 겪는다. 이러한 문제를 해결하기 위해, 본 논문에서는 Cross-view Deep Nearest Neighbor Neural Network(CDN4)라는 새로운 방법을 제안한다. CDN4는 임의의 기하학적 변환을 적용하여 support 및 query 샘플의 다른 view을 생성하고, 이어서 query 특징의 원본 및 변환된 시각과 support 특징의 원본 및 변환된 시각 간의 네 가지 유사성을 활용한다. 이러한 기하학적 증강은 동일한 클래스 내 샘플 간의 다양성을 증가시키며, cross-view 측정은 두 가지 브랜치 간의 교차 비교를 통해 모델이 분류에 더 구별적인 local feature에 집중하도록 유도한다. 광범위한 실험을 통해 CDN4의 우수성이 입증되었으며, 다양한 fine-grained few-shot 벤치마크에서 최신 성능을 달성하였다.

Introduction
few-shot 분류는 적은 수의 라벨링된 샘플만 주어졌을 때 새로운 클래스에 대해 높은 분류 성능을 보이는 모델을 구축하는 패러다임이다. 이 접근법은 데이터가 부족한 상황에서 심층 신경망을 학습할 때의 한계를 완화하는 데 유망한 결과를 보여주고 있다. few-shot 분류에 대한 연구는 대체로 두 가지 부류로 나눌 수 있다. meta-learning 기반 방법과 metric-learning 기반 방법이다. meta-learning 기반 방법은 여러 작업으로부터 작업에 독립적인 지식을 축적하고 이를 새로운 클래스의 적은 샘플에 일반화한다. 반면, metric-learning 기반 방법은 query 이미지와 support 이미지 간의 유사도 메트릭을 기반으로 분류를 수행할 수 있는 심층 임베딩 공간을 학습한다.

메트릭 기반 방법에서, 기존 연구는 이미지 수준의 전역 특징을 채택해왔다. 그러나 전역 특징은 상위 범주 내에서 클래스를 구분하는 fine-grained 이미지 분류에서는 한계를 가진다. 이 과제에서는 클래스 간의 미묘한 차이 때문에 이미지의 특정 영역 내 세부 사항을 모델이 포착하는 것이 매우 중요하다. 예를 들어 조류 분류에서 Field Sparrow와 Savannah Sparrow는 형태가 유사한 두 종이다. 이들을 구분하기 위한 핵심 차이는 머리 무늬 세부 사항에 있는데, 전자는 흰 눈 고리를 가지고 있고, 후자는 노란 눈썹을 가진다. 이러한 작은 지역적 차이에 집중하기 위해, 공간적으로 지역 특징을 추출하는 방법들이 제안되었는데, 이는 저수준 시각 정보가 더 풍부하고 범주 간 전이 가능성이 높다. 이러한 지역 특징을 충분히 활용하기 위해 최근 방법들은 semantic patch 기반 표현을 고려해왔다. 예를 들어, DN4는 이미지 수준 표현 대신 두 이미지의 지역 불변 특징을 사용한다. 그리고 query 이미지의 각 지역 특징에 대해 나이브 베이즈 최근접 이웃 알고리즘을 활용해 가장 가까운 support 지역 특징을 찾는다. 그 후 모든 지역 점수를 나이브 베이즈 방식으로 누적하여, query 이미지와 해당 support 클래스 간의 유사성을 계산한다. DN4는 지역 특징 기반의 최신 방법으로, 명확하고 유망한 아이디어를 가지고 있으며 복잡한 구조를 도입하지 않는다.

이와는 다른 축에서, 많은 few-shot 분류 방법들은 query 이미지의 여러 view에서의 예측 일관성을 최대화하여 모델이 판별적인 특징에 집중하도록 하는 아이디어를 채택하였다. 이러한 여러 view은 데이터 증강을 통해 얻어진다. 예를 들어, IEPT는 이미지를 회전시키고, 네트워크가 회전 각도를 예측하도록 self-supervised loss을 추가한다. 그러나 대부분의 방법들은 동일한 이미지의 여러 증강 버전 간 손실을 계산하는데, 이는 클래스 내부 다양성을 거의 도입하지 못하고, 따라서 판별적 특징 학습이나 일반화 성능 향상에 도움이 되지 않는다. 우리는 증강이 샘플 간에도 적용되어야 하며, 다양한 변환에도 불구하고 중요한 특징으로 남는 것들이 더욱 판별력이 있다고 주장한다.

위의 통찰에 기반하여, 본 논문에서는 fine-grained few-shot 분류를 위해 Cross-view Deep Nearest Neighbor Neural Network(CDN4)라는 새로운 접근법을 제안한다. CDN4는 큰 클래스 내부 다양성 하에서도 매우 판별적인 지역 특징을 학습할 수 있다. 구체적으로, CDN4는 두 가지 모듈로 구성된다.

① Episodic Dual-Branch Structure(EDBS)
② Cross-view Local Metric Module(CLMM)

주어진 에피소드에서, EDBS는 이를 원본 브랜치에서 원본 에피소드로 처리하고, 임의의 기하학적 변환을 적용하여 변환된 브랜치에서 변환된 에피소드를 얻는다. 이 두 에피소드는 이미지의 두 가지 view으로 간주될 수 있으며, 백본 네트워크에 입력되어 특징 임베딩을 추출함으로써 두 개의 독립된 특징 브랜치를 형성한다. CLMM에서는 두 브랜치 간 support와 query의 지역 특징 유사성을 계산한다. 기존 접근법이 원본 support–원본 query 쌍에 대해서만 유사성을 계산한 것과 달리, CLMM은 더 큰 클래스 내부 다양성을 포함하는 세 가지 추가 쌍(원본 support–변환 query, 변환 support–원본 query, 변환 support–변환 query)을 통합한다. 즉, 원본 이미지를 다양한 증강 이미지와 짝지음으로써 클래스 내부 다양성을 크게 확장한다. 결과적으로, 네트워크는 네 가지 유사성 비교에서 올바르게 분류하기 위해 더 판별적인 지역 특징에 집중하도록 강제된다.

요약하자면, 본 논문의 새로운 기여점은 다음 네 가지이다.

① fine-grained few-shot 분류에서 지역 특징의 판별력을 향상시키는 새로운 분류 방법인 CDN4를 제안하였다.
② 샘플에 더 많은 다양성을 도입하기 위해 임의의 기하학적 변환을 적용한 새로운 브랜치를 추가하는 에피소드 이중 브랜치 구조를 설계하였다.
③ 네 가지 데이터 쌍의 유사성에 집중함으로써 모델이 판별적 특징을 학습하도록 강제하는 교차 시각 지역 메트릭 모듈을 설계하였다.
④ CDN4가 네 가지 fine-grained few-shot 이미지 분류 벤치마크에서 최신 성능을 달성했음을 포괄적인 실험 및 절제 연구를 통해 입증하였다.

Related work
ⓐ Metric learning-based few-shot learning
기존 few-shot 학습 방법은 크게 두 가지로 나눌 수 있다.

① meta-learning 기반 방법
예를 들어, MAML은 새로운 작업에 빠르고 우수하게 적응하는 것을 목표로 한다.

② metric-learning 기반 방법
샘플을 판별적인 임베딩 공간에 투영하고, 샘플 간 유사성을 측정하기 위한 메트릭을 정의하거나 학습하는 것을 목표로 한다.

본 연구는 metric-learning 기반 방법에 속하며, 이는 다시 크게 두 가지 흐름으로 분류할 수 있다.

① Image-level Global Features-based Methods
이 방법들은 백본의 마지막 전역 평균 풀링 층에서 얻은 전역 특징을 사용하여 전체 이미지를 표현하고, 이 특징을 특징 공간 내 하나의 데이터 포인트로 취급한다. 예를 들어, ProtoNet은 각 클래스의 support 샘플 평균을 클래스 프로토타입으로 취한다. 그리고 유클리드 거리를 사용하여 query와 클래스 평균 특징 간의 유사성을 측정해 분류를 수행한다. 그러나 이미지의 전역 표현은 fine-grained 이미지 분류에 유용한 지역 특징을 간과할 수 있다.

② Spatially Local Features-based Methods
지역 특징은 이미지의 다양한 부분에 대한 더 풍부한 정보를 제공하며, local feature 기반의 유사성을 학습하는 방법들은 FSL에서 범주 간 전이 성능을 개선하는 것으로 나타났다. DN4는 대표적인 방법 중 하나로, query 특징에 대해 support 특징 풀에서 가장 가까운 k개의 최근접 이웃을 사용하여 local descriptor 기반의 image-to-class 측정을 제안했다. DN4를 기반으로 한 DMN4는 query와 support 간 상호 근접성을 고려해, 작업과 관련된 지역 특징을 선택하고 배경에서 나온 것들은 제거한다. FRN은 support 지역 특징을 사용해 query 지역 특징을 재구성하고, 원본 query 지역 특징과 재구성된 query 지역 특징 간의 최소 유클리드 거리를 기준으로 query 인스턴스를 분류한다. BiFRN은 여기에 더해 클래스 내부 다양성을 줄이기 위해 query 지역 특징을 이용해 support 지역 특징까지 재구성한다. MCL은 support와 query 지역 특징 간의 양방향 관계를 시·불변 마르코프 과정으로 모델링한다. 이를 통해 support → query, query → support 두 방향에서의 랜덤 워크 확률을 계산하고, query가 동일 클래스의 support 특징을 방문할 것으로 기대되는 횟수에 기반해 예측을 수행한다. CTNet은 픽셀과 클래스 특징 간의 상관관계를 계산하여 장거리 공간 의존성을 모델링한다. 이는 모든 픽셀 간 상관관계를 계산하는 표준 self-attention보다 계산 복잡도를 낮추며, 특히 공간적 맥락과 채널 맥락 정보의 상호 보완성을 탐구한다. 이때 공간 맥락 모듈의 입력은 다중 스케일 지역 채널 맥락을 활용해 구성된 중간 특징과 클래스 특징으로 이루어진다. 또한 TDM과 같은 방법은 공간 차원이 아니라 채널 차원의 가중치를 조정한다. TDM은 intra-class와 inter-class의 채널별 대표성 점수를 계산하고 이를 활용해 작업 특화된 가중치 벡터를 도출한다.

본 논문은 DN4를 기반으로 하여 지역 특징의 판별력을 개선하는 것을 목표로 한다. 우리의 연구 동기는 DMN4와 유사하지만 접근 방식은 다르다. DMN4는 판별적인 지역 특징을 식별하기 위해 양방향 지표를 활용하는 반면, 본 연구에서는 원본 support–변환 query, 변환 support–원본 query와 같이 원본과 변환된 샘플을 짝지어 클래스 내부 다양성을 확대한다. 즉, 더 어려운 분류 과제를 형성하여 모델이 더욱 판별적인 특징을 학습하도록 유도한다.

ⓑ Methods related to data augmentation
데이터 증강 관련 방법들은 일반적으로 원본 이미지에 자르기, 수평 뒤집기, 평행이동 또는 더 복잡한 변환을 적용하여 학습 샘플의 수를 늘리고 데이터 다양성을 향상시킨다. 또 다른 접근법으로는, 데이터 증강을 통해 동일 이미지의 서로 다른 view을 얻고, 서로 다른 시각 간의 유사성을 극대화하여 모델이 판별적인 특징에 집중하도록 최적화한다. 예를 들어, contrastive learning는 데이터 증강을 활용해 few-shot 학습에 대조 학습을 도입하였다. ANs-SLA는 데이터 증강을 사용해 자기 지도 학습 과제를 구축하고, 변환된 클래스를 예측함으로써 base 클래스와 novel 클래스 간의 일반화 오류를 줄인다. IEPT는 각 이미지에 회전을 적용하여 증강 이미지를 생성하고, 회전 각도를 예측하기 위한 보조 손실을 계산한다. IEPT를 따른 ESPT는 support 이미지와 query 이미지 간의 관계를 ridge 회귀로 학습하고, 데이터 증강을 다시 활용하여 두 브랜치의 예측 일관성에 기반한 보조 손실을 계산한다. 그러나 이러한 방법들은 모두 하나의 이미지와 그 변환 이미지 간의 관계에 집중하는데, 이 둘의 차이는 상대적으로 제한적이다. Fang 등은 이미지를 패치 수준이나 부분 수준에서 증강할 경우, 세분화 분류에 중요한 의미적 일관성이 훼손될 수 있음을 지적하였다. 이를 해결하기 위해 CSDNet이 제안되었으며, 이는 의미 정보를 고려해 증강 데이터를 생성하고 중요한 특징을 강화한다. 또한 과거 특징을 저장하는 memory bank를 활용하여 특징 수준에서 샘플을 확장한다. 이미지에서 더 많은 정보를 발굴하는 것 외에도, 레이블 정보를 활용하는 방법들도 제안되었다. 예를 들어, KTN은 그래프 합성곱 네트워크를 사용하여 의미 지식과 시각 특징 간의 매핑 네트워크를 구축한 뒤, 지식 기반 분류기와 시각 기반 분류기를 가중치 융합하여 결합한다. 이는 few-shot 분류기에서 의미적 특징을 사전 지식으로 효과적으로 활용하는 방식이다.

우리의 CDN4는 원본 브랜치로부터 변환된 브랜치를 얻기 위해 임의의 기하학적 변환을 적용하고, 두 브랜치 간 cross-view measurement을 수행한다. 이는 데이터 증강을 활용해 이중 브랜치 구조를 구성한 것으로 볼 수 있다.

Methodology
ⓐ Problem formulation
본 연구는 fine-grained few-shot 분류 문제의 표준 프레임워크를 채택한다. 전체 데이터셋 D={(xi, yi),yi∈C}가 주어지며, 여기서 xi는 i-번째 원본 샘플을 나타내고, yi는 해당 샘플의 클래스 레이블을 나타낸다. 레이블 집합 C는 base 클래스 집합 Cb와 novel 클래스 집합 Cn으로 구성되며, 두 집합은 교집합이 없다. 따라서 데이터셋 D는 다음과 같이 두 부분으로 나뉜다.

① meta-training을 위한 base 데이터셋 Db={(xi,yi),yi∈Cb} ② meta-testing를 위한 novel 데이터셋 Dn={(xi,yi),yi∈Cn}

meta-training 단계에서, 심층 신경망은 base 데이터셋에서 학습되어 최적의 모델과 학습된 매개변수를 얻는다. meta-testing 단계에서는, 학습된 모델이 매우 적은 수의 레이블 샘플만 주어진 novel 데이터셋 Dn에서 평가된다. fine-grained few-shot 분류의 궁극적 목표는, base 데이터셋 Db로부터 높은 일반화 성능을 갖춘 지식을 학습하여, 제한된 데이터만으로도 novel 데이터셋 Dn에서 정확한 분류를 수행하는 것이다.

테스트 환경을 모사하고 task 간 일반화를 향상시키기 위해, 본 연구는 few-shot 학습 분야에서 널리 사용되는 episodic strategy을 채택한다. 즉, meta-learning 단계 동안 여러 개의 episode를 수행한다. 이 전략에 따라, base 데이터셋은 여러 에피소드로 나뉜다. 각 에피소드에서, Cb에서 무작위로 N개의 클래스가 선택된다. 각 클래스는 K개의 support 이미지와 q개의 query 이미지로 구성되며, 이를 N-way K-shot 에피소드라고 한다. 구체적으로, 각 에피소드는 e={S,Q}로 표시되며, 여기서 support 집합은 S={(xi,yi)} (i=1 ~ N×K), query 집합은 Q={(xj,yj)} (j=1 ~ N×q)이다. Support와 query 집합은 동일한 레이블 공간 Cb에서 추출되며, 서로 겹치지 않는다. 에피소드 학습 과정에서 query 집합 Q의 샘플들은 support 집합 S를 기반으로 분류되며, 이를 통해 학습된 모델을 얻는다.

meta-testing 단계에서는, meta-learning 단계에서 선택된 모델이 novel 클래스 Cn에서 N-way K-shot 분류를 수행한다. 평가를 위해 일반적으로 novel 클래스에서 에피소드 En를 구성하고, 여러 에피소드에 대한 평균 정확도를 보고한다.

ⓑ Overview of CDN4
모델 구조는 Episodic Dual-Branch Structure(EDBS) fγ와 Cross-View Local Metric Module(CLMM) gϕ로 구성된다.

먼저, EDBS fγ에서는 원본 에피소드에 임의의 기하학적 변환을 적용하여 이미지 변환을 수행하고, 그에 해당하는 변환된 에피소드를 얻는다. 이후, 원본 에피소드와 변환된 에피소드의 특징을 백본 네트워크 fθ를 통해 추출한다. 마지막으로, 원본 특징과 변환된 특징을 CLMM gϕ에 입력하여, 이 모듈 내에서 cross-view 측정을 구성하고 최종 거리 메트릭을 계산한다.

ⓒ Episodic Dual-Branch Structure (EDBS)
우리의 방법에서는, 주어진 에피소드 e를 원본 에피소드로 간주하고 원본 분기를 통해 처리한다. 변환된 분기는 원본 에피소드를 변환하여 얻는다. 이 두 분기는 Episodic Dual-Branch Structure를 형성한다.

구체적으로, 원본 support 집합과 query 집합을 모두 포함하는 원본 에피소드 e = {S, Q}가 주어졌을 때, 우리는 무작위 기하학적 변환 T ∈ {tr| r = 1,…,3}을 사용하여 이 에피소드 내의 모든 이미지를 회전시켜 변환된 에피소드 eᵀ = {Sᵀ, Qᵀ}를 얻는다. 여기서 tr은 이미지를 r × 90° 회전시키는 연산자이다. 이와 같은 방식으로, 원본 에피소드 e와 변환된 에피소드 eᵀ의 이중 분기를 구성한다. 즉, 원본 support 집합 S와 원본 query 집합 Q, 그리고 변환된 support 집합 Sᵀ과 변환된 query 집합 Qᵀ로 이루어진 두 개의 분기를 구성하는 셈이다. 중요한 점은, 무작위 기하학적 변환은 샘플 이미지를 변화시키지만 라벨은 바꾸지 않는다는 것이다.

그 다음, 두 에피소드는 동일한 백본 네트워크 fθ에 입력되어 특징 z를 추출한다. 이를 통해 support 집합과 query 집합을 다음과 같이 얻는다.

원본 에피소드로부터: Zs, Zq
변환된 에피소드로부터: ZsT, ZqT

임베딩된 특징 z는 이후 공간적으로 local features로 변환된다. 즉, 각 이미지는 HW 개의 C차원 지역 특징을 가지게 된다.

local features는 서로 다른 구분력과 전이 가능한 정보를 제공하여 모델의 일반화 성능을 향상시킬 수 있을 것으로 기대된다. 이는 fine-grained few-shot 이미지 분류에서 중요한 단서가 된다. 동시에, 변환은 특징의 라벨을 변경하지 않으므로, 듀얼 브랜치 구조는 더 많은 샘플 다양성을 제공할 수 있다.

다음 절에서는 원본 및 변환된 view에서 support 샘플과 query 샘플의 지역 특징 간 유사도를 계산할 것이다. 모든 시각에서의 분류 정확도를 최대화함으로써, 모델이 구분력 있는 특징에 집중하도록 유도한다.

ⓓ Cross-view Local Metric Module (CLMM)
-Construct cross-view measurement
앞서 설명한 EDBS를 사용하여, 두 개의 브랜치 e와 eT를 얻는다. 여기서 원본 브랜치는 원본 support 집합 Xs와 원본 query 집합 Xq를 포함하며, 변환된 브랜치는 변환된 support 집합 XsT와 변환된 query 집합 XqT를 포함한다. 이후 네 가지 cross-view 측정을 구성한다.

① 원본 support – 원본 query 쌍 {Zi,Zj}
② 원본 support – 변환된 query 쌍 {Zi,ZjT}
③ 변환된 support – 원본 query 쌍 {ZiT,Zj}
④ 변환된 support – 변환된 query 쌍 {ZiT,ZjT}

여기서 i∈[1,…,N]는 i-번째 클래스의 support 샘플을, j∈[1,…,N×q]는 분류 대상인 j-번째 query 샘플을 의미한다. K>1인 경우에는 ProtoNet 방식에 따라 support 클래스의 프로토타입을 그 클래스의 대표로 계산한다.

-Local measurement analogously to DN4
그 후, DN4에서 제안된 image-to-class 측정 방식을 채택하여 개별 쌍 간의 유사도를 계산한다. (설명을 단순화하기 위해, 여기서는 Z의 위 첨자 T를 생략하고 원본 데이터와 변환된 데이터를 구분하지 않는다.)

각 support 특징 Zi와 query 특징 Zj은 m=H×W개의 local features을 포함한다. Image-to-class 유사도를 계산하기 위해, 각 query 지역 특징마다 support 샘플에서 top-1 최근접 이웃 local feature를 찾고, 이 두 local feature 간의 유사도를 계산한 뒤, query의 모든 지역 특징에 대한 유사도를 평균낸다.

구체적으로, 먼저 i-번째 클래스와 j-번째 query 간의 유사도 행렬을 코사인 유사도를 사용하여 계산한다.

Mij의 각 행은 query 샘플의 하나의 local feature와 특정 클래스의 모든 support 지역 특징 간 코사인 유사도를 나타낸다.

그 다음, 각 유사도 행렬에서 각 행의 top-1 값을 추출하여, query 샘플의 각 local feature에 대해 가장 가까운 support local feature를 결정한다.

DN4는 top-k를 사용하여 k개의 최근접 이웃 LFs를 찾고 이들의 유사도를 평균내지만, 본 연구에서는 단순화를 위해 top-1만 사용한다. 마지막으로, query의 모든 지역 특징에 대해 평균을 내어 i-번째 support 클래스와 j-번째 query 이미지 간의 유사도 sij를 얻는다.

종합적으로, image-to-class 측정 방식은 다음과 같다.

-Similarity measure
N-way K-shot 에피소드에서, 위에서 설명한 EDBS는 원본 support 특징 Zi, 변환된 support 특징 ZiT, 원본 query 특징 Zj, 변환된 query 특징 ZjT를 생성한다. 이제 앞서 정의한 image-to-class 측정 방식을 사용하여 모든 cross-view 조합에 대한 유사도를 계산할 수 있다.

먼저, 네 가지 cross-view 데이터 쌍에 대해 유사도를 계산한다.

① s(1,ij)=sim(Zi,Zj) — 원본 support와 원본 query 간 유사도
② s(2,ij)=sim(ZiT,Zj) — 변환된 support와 원본 query 간 유사도
③ s(3,ij)=sim(Zi,ZjT) — 원본 support와 변환된 query 간 유사도
④ s(4,ij)=sim(ZiT,ZjT) — 변환된 support와 변환된 query 간 유사도

여기서 s(1,ij), s(2,ij), s(3,ij), s(4,ij)는 j-번째 query 샘플과 i-번째 클래스 간 다양한 쌍의 유사도를 나타낸다.유사도는 다음과 같이 정규화된다.

-Loss functions
정규화된 유사도를 기반으로, N-way K-shot 에피소드에서의 cross-entropy loss은 다음과 같이 계산된다.

마지막으로, 이 네 가지 손실 함수를 단순 평균하여 cross-view 손실을 얻는다.

훈련 단계에서 모델은 이 cross-view 손실 함수를 기반으로 학습되며, 최적화는 CUB-200-2011 데이터셋에서는 SGD 옵티마이저를, meta-iNat 및 tiered-meta-iNat 데이터셋에서는 Adam 옵티마이저를 사용하여 수행된다.

-Test phase
테스트 단계에서 query 이미지를 분류하기 위해, 네 가지 쌍 간의 유사도를 계산하고 이들의 단순 평균을 사용하여 query 이미지와 support 클래스 간의 최종 유사도를 얻는다. 모델은 query 이미지를 가장 큰 유사도를 갖는 클래스에 할당한다.

Experiments
ⓐ Datasets
본 연구의 실험은 fine-grained few-shot 이미지 분류에서 널리 사용되는 네 가지 데이터셋에서 수행되었다. 사용된 데이터셋은 Caltech-UCSD Birds-200-2011, meta-iNat, tiered-meta-iNat, GVC-Aircraft이다.

CUB-200-2011은 fine-grained 이미지 분류에서 널리 사용되는 대표적인 데이터셋으로, 200종의 새에 속하는 총 11788장의 이미지로 구성되어 있다. 이 데이터셋은 100개의 학습 클래스, 50개의 검증 클래스, 50개의 테스트 클래스로 분할되었다. 또한 각 이미지는 사람이 주석한 바운딩 박스 정보를 기반으로 사전에 크롭되었다.

meta-iNat은 야생 동물 종을 대상으로 한 fine-grained 벤치마크 데이터셋이다. 이 데이터셋은 13개의 하위 카테고리에 걸쳐 1135개의 동물 종을 포함하며, 각 종은 50장에서 최대 1000장의 이미지를 가진다. 908개 클래스는 학습용으로, 나머지 227개 클래스는 테스트용으로 사용된다.

tiered-meta-iNat은 meta-iNat의 변형 버전으로, 동일한 이미지 세트를 사용하지만 학습 클래스와 테스트 클래스 간의 도메인 차이를 크게 두어 보다 어려운 시나리오를 제공한다. 학습 세트는 파충류, 조류 등 상위 카테고리에 속하는 781개 클래스이며, 테스트 세트는 곤충, 거미류 등 상위 카테고리에 속하는 354개 클래스로 구성된다.

Aircraft 데이터셋은 총 100종의 항공기 모델을 포함하며, 각 모델은 100장의 이미지를 가진다. 이 데이터셋은 50개의 학습 클래스, 25개의 검증 클래스, 25개의 테스트 클래스로 나뉘어 사용된다.

ⓑ Implementation details
-Backbone Network
공정한 비교를 위해, 본 연구에서는 널리 사용되는 백본 네트워크인ResNet-12를 채택하여 실험을 수행하였다. 마지막 전역 평균 풀링층을 제거하고, 피처 피라미드 구조를 활용하여 더 조밀한 특징을 얻도록 하였으며, 이를 본 모델의 특징 추출기로 사용하였다. meta-training에 들어가기 전에 백본 네트워크를 mini-ImageNet 데이터셋으로 사전 학습하였다. 구체적으로는 mini-ImageNet에서 총 350 에포크 동안 학습을 진행했으며, 배치 크기는 128로 설정하고, SGD 옵티마이저를 사용하였다. 초기 학습률은 0.1로 두고, 200 에포크와 300 에포크에서 학습률을 0.1 배로 감소시켰다.

-Training Details
공정한 비교를 위해, FRN에서 제안한 설정을 채택하였다. CUB-200-2011 데이터셋의 경우, Nesterov 모멘텀 0.9를 적용한 SGD 옵티마이저를 사용하였으며, 초기 학습률 0.1을 설정하여 학습을 진행하였다. 모델은 처음부터 600개의 에피소드 동안 학습되었으며, 300, 400, 500 에포크에서 학습률을 10배씩 줄였다. 각 에피소드는 하나의 N-way K-shot 과제로 구성된다. 본 연구에서는 10-way 5-shot 또는 10-way 1-shot 학습 설정을 채택하였으며, 이는 각각 5-way 5-shot 또는 5-way 1-shot 테스트 설정에 대응된다.

meta-iNat 및 tiered-meta-iNat 데이터셋에 대한 실험에서는 모델을 100 epoch 동안 학습하였다. 이때 Adam 옵티마이저를 사용하였으며, 초기 학습률은 0.001로 설정하였다. 또한 20 epoch마다 학습률을 0.5배로 감소시켰다. 본 방법은 PyTorch로 구현되었으며, NVIDIA GeForce RTX 4090 (24GB 메모리) 환경에서 실행되었다.

-Evaluation
테스트 단계에서는 본 접근법의 성능을 표준적인 5-way 1-shot 및 5-way 5-shot 시나리오에서 평가하였다. 각 실험을 위해 테스트 세트에서 무작위로 10000개의 에피소드를 샘플링하였으며, 평균 정확도를 평가 지표로 사용하였다. 각 에피소드에서, 5-way 1-shot 및 5-way 5-shot 과제의 평가를 위해 클래스당 무작위로 15장의 query 이미지를 선택하였다.

ⓒ Comparison with state-of-the-arts methods
제안하는 CDN4의 효과는 여러 대표적인 최신 기법들과 비교하여 평가되었으며, 모든 비교 방법은 ResNet-12를 특징 추출기로 사용하였다. 비교 대상에는 2가지 global feature 기반 방법(ProtoNet, DSN)과, 12가지 공간적 local feature 기반 방법이 포함된다. 후자에는 DN4와 그 개선 방법인 DMN4, FRN과 그 개선 방법들(TDM, LCCRN, Bi-FRN), 그리고 CTX, DeepEMD, MCL-Katz, IEPT, ESPT, C2-Net, SRM 등이 있다.

제안된 접근법은 세 가지 데이터셋 모두에서 기존의 최신 기법들보다 지속적으로 우수한 성능을 보였다. 구체적으로, CDN4는 CUB-200-2011에서 86.47% (1-shot), 94.58% (5-shot), meta-iNat에서 82.05% (1-shot), 93.07% (5-shot), tiered-meta-iNat에서 54.76% (1-shot), 78.09% (5-shot), Aircraft에서 88.98% (1-shot), 94.43% (5-shot)의 최신 성능을 달성하였다. 특히, 더 어려운 데이터셋인 tiered-meta-iNat에서 CDN4의 우수성이 두드러졌는데, 1-shot 설정에서 두 번째로 좋은 결과보다 3.10% 높았고, 5-shot 설정에서는 3.22% 더 높았다.

종합적으로, 이러한 실험 결과는 제안된 CDN4가 fine-grained few-shot 이미지 분류 과제에서 최적의 성능을 달성했음을 보여준다. 이는 설계된 모듈들을 통해 클래스 내 변화를 더 많이 도입함으로써, 제안된 모델이 더 강력한 전이 가능하고 판별적인 특징을 학습하며 일반화 능력을 향상시킬 수 있음을 의미한다.

ⓓ Ablation studies
-Effectiveness of individual modules
Episodic Dual-Branch Structure (EDBS)와 Cross-view Local Metrics Module (CLMM)의 효과를 평가하기 위해 두 가지 실험을 수행하였다.

① DN4 위에 EDBS를 추가하였다. 이 모듈은 무작위 기하학적 변환을 도입하여 두 개의 브랜치를 생성한다. 이후, 원본 support–원본 query 쌍과 변환된 support–변환된 query 쌍만을 사용하여 정규화된 유사도를 계산하였다. 즉, s1과 s4만 포함하며, 손실 함수는 L1과 L4의 평균으로 설정하였다.

② DN4 + EDBS 위에 CLMM을 추가하였다. CLMM은 두 브랜치 간의 support와 query의 로컬 특징 유사도를 계산하므로 단독으로는 구현할 수 없다. 따라서 DN4 + EDBS 위에 추가되었으며, 이는 제안된 CDN4와 동일하다. 이를 통해 네 가지 교차 시각 데이터 쌍 전체에서 유사도를 정규화하고, 손실 함수에 L2와 L3를 포함시키는 효과를 검증할 수 있었다.

EDBS 도입 후 분류 정확도가 크게 향상되었다. 이는 클래스 내 변화를 증가시켜 분류 성능을 높이는 것이 중요함을 보여준다. 또한 CLMM의 두 cross-view 측정 쌍이 도입된 후 정확도가 소폭 더 개선되었다. 이는 특히 원본 이미지와 변환된 이미지를 짝지음으로써 더 큰 클래스 내 차이를 만들어내는 경우, 네 가지 시각에서 높은 유사도를 유지하도록 모델을 학습시키는 것이 다양한 시각에서도 일관되게 유지되는 판별적 특징을 학습하는 데 기여함을 의미한다.

-Influence of random geometric transformations
EDBS는 임의의 기하학적 변환 T을 적용하여 변환된 에피소드를 생성한다. 본 절에서는 서로 다른 변환 방법이 분류 정확도에 미치는 영향을 논의한다.

처음 네 행은 회전 연산을 다른 단일 변환(랜덤 지우기, 믹스업, 시어, 플립)으로 대체했을 때의 성능을 보여준다. 그 결과, 랜덤 지우기, 믹스업, 시어를 사용하는 경우는 본 논문에서 채택한 회전을 사용하는 경우보다 성능이 떨어졌으며, 플립은 회전과 유사한 결과를 보였다. 이는 판별적인 특징이 보통 이미지의 작은 영역에만 존재하기 때문에, 큰 변형이 가해질 경우 쉽게 왜곡될 수 있기 때문으로 해석된다.

이후, 회전과 플립이 모두 다른 변환보다 우수한 성능을 보였기 때문에 두 방법을 결합해 보았다. 다섯 번째 행에서는 원본 에피소드에 회전과 플립을 동시에 적용하였고, 여섯 번째 행에서는 무작위로 회전 또는 플립 중 하나를 선택하여 적용하였다. 두 결과를 비교하면, 한 번에 하나의 변환만 사용하는 것이 두 가지 변환을 동시에 사용하는 것보다 더 우수함을 알 수 있다.

마지막으로, 본 논문에서 제안한 회전 단독 방식과 비교했을 때, 무작위로 회전 또는 플립을 적용하는 방법은 CUB-200-2011과 meta-iNat 데이터셋에서는 더 나은 성능을 보였으나, 더 복잡한 tiered-meta-iNat 데이터셋에서는 성능이 저하되었다. 이는 변환의 다양성이 지나치게 커지면 모델을 혼란스럽게 하여 판별적인 특징을 학습하기 어렵게 만들기 때문으로 보인다. 두 방식 간의 차이는 상대적으로 작으며, 단순성을 위해 본 논문에서는 회전만을 사용하기로 선택하였다.

-Influence of the rotation set
CDN4에서는 임의의 기하학적 변환 T∈{tr∣r=1,…,3}을 사용하여 원본 브랜치로부터 변환된 브랜치를 생성한다. 이 과정에서 에피소드의 모든 이미지를 r×90°만큼 무작위로 회전시킨다. 본 절에서는 서로 다른 회전 집합이 분류 정확도에 어떤 영향을 미치는지 조사한다.

처음 세 행에서는 단일 회전 변환(이미지를 90°, 180°, 270° 중 하나로 회전)을 적용한 경우를 살펴보고, 4–6행에서는 두 개의 회전 각도 중 무작위로 선택하여 적용하였다. 마지막 행에서는 세 가지 회전 각도(본 논문의 방법) 중 무작위로 선택하여 적용하였다. 결과적으로, 특정 회전 집합이 다른 경우보다 성능이 더 우수하다고 보기 어렵고, 전반적으로 분류 정확도는 유사한 수준임을 확인할 수 있다. 이는 제안된 접근법이 다양한 회전 각도 선택에 대해 안정적임을 시사한다.

-Influence of cross-view measurements
CLMM에서는 네 가지 cross-view 측정이 구성되며, 이로부터 네 개의 교차 엔트로피 손실이 계산되어 결합되고, 이를 통해 최종 교차 시각 손실 Lcross이 생성된다. 본 절에서는 서로 다른 데이터 쌍이 분류 정확도에 미치는 영향을 평가한다.

처음 네 행은 각각 단일 손실 함수(L1,L2,L3,L4)만을 사용해 네트워크를 학습한 경우를 보고한다. 다섯 번째 행은 동일한 브랜치에서 가져온 support와 query 샘플로 계산된 L1과 L4만을 사용하고, 여섯 번째 행은 서로 다른 브랜치에서 가져온 샘플로 계산된 L2와 L3만을 사용한다. 마지막 행은 본 논문에서 제안한 방법으로, 네 손실(L1,L2,L3,L4)의 평균을 내어 Lcross를 생성한다.

이 결과들을 비교하면 다음과 같은 관찰을 할 수 있다. 첫째, 결합 손실 함수 L1+L4는 개별 손실 함수보다 더 나은 성능을 보였고, L2+L
3도 여섯 경우 중 다섯 경우에서 개별 손실보다 우수했다. 이는 유사도 비교 횟수를 늘리는 것이 더 판별적인 특징 학습에 도움이 됨을 의미한다. 특히 CUB-200-2011의 1-shot에서 84.25%로 낮게 나온 성능은, 샘플 수가 너무 적어 우리가 도입한 큰 intra-class 변화를 극복할 수 있는 판별적 특징 학습이 제한되었기 때문일 가능성이 크다.

둘째, L1 단독 성능은 L2,L3,L4 단독 성능보다 좋았으며, L1+L4 조합은 L2+L3 조합보다 더 우수했다. 이는 원본 support–원본 query 쌍을 유지하는 것이 중요하며, 일반적으로 더 쉬운 경우를 먼저 포함한 후에 다양한 데이터로 확장하는 것이 효과적임을 시사한다. 즉, 처음부터 어려운 과제를 학습하는 것은 학습 과정을 방해할 수 있다.

셋째, 두 개 손실을 사용하는 것보다 네 개 손실을 모두 사용하는 경우 성능이 더욱 향상되었다. 교차 시각 측정은 원본 브랜치와 변환 브랜치 간의 상호작용을 통해 클래스 내 변화를 증가시키고, 모델이 판별적 특징에 더 집중하도록 유도한다.

-Influence of the similarity measure
CLMM에서 또 다른 중요한 요소는 support와 query 샘플의 지역 특징 간 유사도 측정 방법이다. 본 논문에서는 기본적으로 코사인 유사도를 사용한다. 본 절에서는 이를 확장하여 유클리드 거리, 맨해튼 거리, 체비셰프 거리의 세 가지 다른 거리 척도를 평가한다. 또한 코사인 유사도를 직접 최적화할 경우 그 값의 범위가 제한적이어서 네트워크가 수렴하지 못할 수 있으며, 이를 해결하기 위해 스케일링 파라미터를 도입하는 것이 권장된다. 따라서 각 유사도 측정에 대해, 학습 가능한 스케일링 요소를 적용한 경우와 적용하지 않은 경우 모두를 고려하였다. 이 스케일링 요소는 학습 과정에서 다른 네트워크 파라미터와 함께 최적화된다.

스케일링 없이 적용한 유클리드, 맨해튼, 체비셰프 거리의 성능이 매우 낮아 정확도는 보고하지 않았다. 먼저, 학습 가능한 스케일링 요소는 유용한데, 이는 코사인 유사도의 분류 정확도를 여섯 가지 경우 중 네 가지에서 향상시켰다. 둘째, 코사인 유사도는 스케일링 적용 여부와 관계없이 일관되게 다른 거리 척도보다 우수한 성능을 보였다. 이는 이전 연구들과도 일치하는데, 코사인 유사도가 소프트맥스 손실과 본질적으로 일관성을 가지며, 각도적 분리도를 최대화하도록 유도한다는 점과 맞아떨어진다.

Conclusion
이 연구에서는 fine-grained few-shot 이미지 분류를 위해 새로운 Cross-view Deep Nearest Neighbor Neural Network (CDN4)를 제안한다. 우리의 접근 방식은 Episodic Dual-Branch Structure (EDBS)와 Cross-view Local Metric Module (CLMM)을 통합하여, 두 개의 브랜치 간 cross-view 측정을 구축함으로써 보다 판별력 있는 특징을 얻고 더 정확한 메트릭을 달성할 수 있도록 한다.

광범위한 실험을 통해 제안한 방법이 우수한 분류 정확도와 일반화 성능을 달성하며, 다양한 데이터 증강 상황에서도 안정적인 성능을 보임을 확인하였다.

향후 연구에서는 CLIP과 같은 사전 학습된 기초 모델에 본 방법을 적용하는 가능성을 탐구할 예정이다. 또한, 훈련 및 추론 시간이 다소 길다는 점을 고려하여 특징 추출과 유사도 계산 과정을 병렬화할 계획이다.

profile
김준형

0개의 댓글