Descriptor and Word Soups : Overcoming the Parameter Efficiency Accuracy Tradeoff for Out-of-Distribution Few-shot Learning 논문 리뷰

김준형·2025년 9월 8일

딥러닝 논문 리뷰

목록 보기
19/33

Abstract
지난 1년 동안 GPT descriptor를 활용한 zero-shot 평가를 중심으로 한 multimodal 연구가 활발히 진행되었다. 이러한 연구들은 GPT가 생성한 레이블별 텍스트 앙상블을 통해 사전 학습된 VL 모델의 zero-shot 정확도를 향상시켰다. 최근 WaffleCLIP 연구에서는 무작위 설명자의 앙상블을 사용해도 유사한 zero-shot 정확도를 달성할 수 있음을 보였다. 그러나 두 zero-shot 방법 모두 학습이 불가능하며, few-shot OOD 데이터가 주어졌을 때는 최적이 아니다. 이러한 기존 연구에 영감을 받아, 우리는 descriptor soup과 word soup이라는 두 가지 유연한 방법을 제안한다. 이 방법들은 테스트 시 LLM을 필요로 하지 않으며, 학습 데이터를 활용하여 OOD 목표 정확도를 높일 수 있다. Descriptor soup은 일반적인 few-shot 학습 데이터를 사용하여 소수의 텍스트 설명자를 탐욕적으로 선택한 뒤, 이를 이용해 강건한 클래스 임베딩을 계산한다. Word soup은 유사한 방식으로 단어들을 연결해 체인을 구성한다. 기존의 few-shot soft prompt tuning 방법과 비교할 때, word soup은 구조적으로 적은 파라미터만 필요하며 역전파를 요구하지 않으므로 GPU 메모리 사용량도 적다. 두 soup 모두 교차 데이터셋 및 도메인 일반화 벤치마크에서 최신 few-shot 방법들을 능가하며, 최첨단 zero-shot 방법과 결합했을 때도 우수한 성능을 보인다. 또한 ProDA 및 WaffleCLIP과 같은 최신 프롬프트 및 설명자 앙상블 방법과 비교했을 때, word soup은 더 적은 앙상블 멤버로 더 높은 OOD 정확도를 달성한다.

Introduction
ⓐ Problem Setting
분포 변화에 강건한 분류기를 학습하는 것은 컴퓨터 비전 분야에서 큰 관심을 받아왔다. 초기 연구는 단순한 분포 변화에 집중했다. 연구가 발전하면서 점점 더 까다로운 적응 문제가 제안되었는데, 이는 기존의 제한적 가정을 제거함으로써 이루어졌다. 예를 들어, 도메인 일반화 문제에서는 라벨 없는 타깃 데이터에 접근할 수 없다고 가정하고, 교차 데이터셋 일반화 문제에서는 소스와 타깃의 라벨 공간이 다를 수 있다고 가정하며, 파라미터 효율적 학습 문제에서는 조정할 수 있는 파라미터 수에 엄격한 제한을 둔다. 본 연구는 이 세 가지 주제의 교차점에 위치한다. CoOp 및 MaPLe와 유사하게, 우리는 ImageNet과 같은 소량의 레이블이 붙은 일반 소스 데이터를 사용할 수 있다고 가정한다. 소스와 타깃 데이터셋 간의 관계에 대해 아무 가정도 하지 않기 때문에, 이 설정은 엄격한 zero-shot 학습보다 실제로 더 유용하다. 본 논문에서는 word soup과 descriptor soup이라는 두 가지 파라미터 효율적인 few-shot 방법을 제안하며, 이는 처음 보는 라벨이나 이미지 분포 변화가 포함된 타깃 데이터셋에 대해 일반화할 수 있도록 VL 모델을 미세 조정한다. 우리의 방법은 추가적인 기울기 기반 튜닝 없이도 일부 벤치마크에서 최신 성능을 달성했으며, diversity loss를 추가하면 최신 기울기 기반 미세 조정 방법도 개선할 수 있다.

ⓑ Motivation
본 연구는 최근 zero-shot 분류와 open-vocabulary 객체 탐지에서 성공한 설명 기반 분류 방법에서 영감을 얻었다. 이러한 방법은 GPT와 같은 LLM에게 각 클래스에 대한 짧은 설명을 생성하도록 요청한 뒤, 이를 집계하여 zero-shot 정확도를 높인다. 많은 연구에서 GPT 설명자가 제공하는 추가 정보 덕분에 zero-shot 성능이 향상된다고 주장한다. 그러나 WaffleCLIP
연구에서는 무작위 설명자나 심지어 무작위 단어 묶음도 GPT 설명자와 유사한 zero-shot 정확도를 달성할 수 있다고 관찰했다. 따라서 설명자 기반 방법이 달성한 zero-shot 정확도 향상은 주로 content가 아니라 앙상블 효과에서 비롯된 것이다. 이 관찰에서 영감을 받아, 우리는 descriptor soup과 word soup이라는 두 가지 방법을 제안하며, 이는 few-shot 정확도를 최대화하는 설명자나 단어 체인을 선택함으로써 WaffleCLIP보다 더 우수한 성능을 낸다. 특히 word soup은 세 가지 장점이 있다.

① few-shot OOD 상황에서 직접적으로 분류 정확도를 최대화하기 때문에 기존 설명자 기반 zero-shot 방법보다 성능이 뛰어나다.
② 모델이 고정되어 있고 불연속적인 설명자 토큰만 저장하면 되므로, 기존 few-shot 방법보다 파라미터 효율적이다.
③ LLM이 필요하지 않다.

ⓒ Method Overview
위 동기에 따라 우리는 세 가지 방법을 점진적으로 설계했다.

① descriptor soup
② word soup
③ diversity loss를 추가한 word soup

이 방법들은 같은 기반 위에 구축되었지만 독립적으로 또는 기존 방법과 조합하여 사용할 수 있다. 우리는 각 단계마다 실험적 통찰이 있으며, 자원 제약에 따라 각 방법이 최적의 성능을 달성할 수 있기 때문에 이런 서술 방식을 선택했다.

Descriptor soup은 model soups에서 아이디어를 가져왔으며, 여기서 "soup"은 설명자 집합을 의미한다. 우리는 soup 내 설명자의 중심을 기반으로 집계 예측을 계산한다. 학습 데이터에서 가장 정확한 설명자로 시작한 뒤, 학습 정확도가 증가하면 greedy하게 설명자를 soup에 추가한다. Word soup도 유사하게, 단어 체인을 구성할 때 학습 정확도가 증가하면 단어를 추가한다. 마지막으로, word soup을 초기화로 사용하여 CLIP 모델을 최적화할 수 있는 diversity loss를 제안한다. 이 손실 함수는 미세 조정 과정에서 word soup 구성원 간의 초기 다양성을 유지하는 데 필요하다.

ⓓ Contributions
연구 기여 본 논문은 컴퓨터 비전 문헌에 다음과 같은 기여를 한다.

① word soup을 제안하며, 이는 few-shot 교차 데이터셋과 도메인 일반화 벤치마크에서 각각 1%와 0.8%의 최신 성능 향상을 달성한다.
② word soup은 최신 파라미터 효율적인 방법보다 더 적은 파라미터를 사용하면서, 파라미터 프리 zero-shot 방법보다 높은 정확도를 few-shot 설정에서 달성한다.
③ word soup으로 초기화된 VL 모델을 학습하기 위한 diversity loss를 제안한다. 이는 기존 few-shot 미세 조정 방법과 매끄럽게 결합될 수 있다.
④ 설명자가 “좋다”는 의미가 무엇인지 이해하기 위한 정성적 결과를 제시하고, 이러한 설명자의 일반화 가능성을 분석한다. 이는 설명자 및 프롬프트 기반 방법이 어떻게 작동하는지에 대한 현재 이해를 확장한다.

Related Work
ⓐ Few-shot CLIP finetuning
우리는 CoOp, CoCoOp, MaPLe, Clipood의 문제 설정을 따른다. 이들은 few-shot ImageNet에서 CLIP 유사 모델을 미세 조정하여 OOD 타깃 데이터셋으로 일반화한다.

많은 프롬프트 튜닝 방법들은 CoOp 위에 구축되며, 서로 다른 손실 함수 사용, 정교한 최적화 기법 적용, 다중 프롬프트 앙상블링, 다양한 정보 소스 활용, 모달리티 간 시너지 활용, 다른 네트워크 아키텍처 사용 등을 포함한다.

우리는 이러한 기존 방법들과는 근본적으로 다른 접근법을 취하며, 설명을 통한 분류에서 영감을 얻는다. 구체적으로, 기존 방법들이 soft prompt를 튜닝하는 반면, 우리의 방법은 이산적 토큰을 튜닝한다.

ⓑ Zero-shot CLIP
최근 많은 연구들이 분류 및 탐지를 포함한 zero-shot 또는 open-vocabulary visual task을 지원하기 위해 LLM 기반 설명자를 사용한다.

WaffleCLIP은 이러한 연구들에서 보고된 인상적인 정확도 향상이 대부분 앙상블링과 데이터셋 수준의 개념에서 비롯된 것임을 관찰하였다.

WaffleCLIP은 무작위 설명자들을 앙상블링하고, LLM을 이용해 데이터셋 수준 개념을 발견하는 반면, 우리는 데이터로부터 좋은 설명자를 학습하는 최적화 절차를 설계한다.

우리의 알고리즘은 모델 평균화 기법들과 느슨하게 관련이 있다. 그러나 model soups과 달리, 우리는 여러 개의 학습 경로를 생성하지 않는다. 왜냐하면 모든 설명자들이 동일한 모델 가중치를 공유하기 때문이다.

zero-shot 정확도는 또한 계층적 라벨 집합이나 수작업 프롬프트로 향상될 수 있다.

테스트 시 프롬프트 튜닝 방법들은 이미지 증강 집합에 기반한 예측 간의 일치를 최대화하는, 샘플 특화 프롬프트를 학습한다. 그러나 이러한 방법들은 테스트 시 최적화 때문에 긴 추론 시간을 겪는 단점이 있다.

Method
이 절은 네 부분으로 구성된다. ⓐ에서는 설명 기반 분류와 WaffleCLIP 방법을 검토하며, 이는 본 연구의 soup 방법을 고안하는 데 동기를 제공한다. ⓑ에서는 descriptor soup을 소개하는데, 이는 학습 시에는 여전히 GPT 설명자를 사용하지만, 테스트 시에는 필요 없는 새로운 중간적 방법이다. ⓒ에서는 word soup을 제시하며, 유사한 동기를 가지고 있지만 학습 시 단지 영어 단어 리스트만 필요하다. ⓓ에서는 word soup을 초기화로 사용하여 CLIP 모델을 finetune할 때 적용되는 diversity loss를 설명한다. 우리는 이 절의 방법들을 점진적으로 유연성이 증가하는 순서대로 정리했는데, 이는 word soup의 필요성을 자연스럽게 설명하기 위함이다.

ⓐ LLM Descriptors and WaffleCLIP
여러 연구에서는 VL 모델에서 클래스 이름을 보완하기 위해 LLM 설명자를 활용한다. 이러한 방법은 LLM에게 분류 대상 객체를 묘사하도록 요청하고, 이를 텍스트 입력에 포함시켜 문장을 형성한다. 예를 들어, “a photo of a tench, which is a freshwater fish” 또는 “a photo of a goldfish, which has small black eyes”와 같은 문장이다. LLM은 평균적으로 클래스당 약 5.8개의 설명자를 생성하며, 이들 텍스트 임베딩의 centroid을 이용해 zero-shot 이미지 분류를 수행한다. zero-shot 정확도의 향상은 LLM이 제공하는 추가 정보와 앙상블 효과에서 기인한다고 볼 수 있다.

WaffleCLIP에서 정확도 향상의 대부분이 사실상 앙상블 효과에서 비롯된 것이라고 주장했다. 그들은 클래스 이름에 유사한 수의 무작위 설명자를 추가하기만 해도 GPT 설명자와 비슷한 zero-shot 정확도를 달성할 수 있음을 보였다. 우리는 few-shot 학습 정확도를 최대화하는 설명자를 선택하면 무작위 설명자보다 더 높은 정확도를 얻을 수 있을 것이라고 판단하며, 이것이 descriptor soup을 고안하게 된 동기다.

ⓑ Descriptor Soup
D = {d1, ..., dn}을 “which is a freshwater fish”와 같은 n개의 설명자 집합이라 하자. 이러한 설명자는 GPT가 1000개의 ImageNet 클래스에 대해 생성한 모든 설명자를 합쳐 고유한 항목만 남긴 것이다. 설명자들은 출신 클래스 정보와 분리된 독립적인 텍스트 조각으로 다뤄진다. 우리의 목표는 few-shot 학습 데이터에서 정확도를 최대화하는 m개의 설명자 집합을 선택하는 것이다. 손실 함수 ℓ(Strain, Ttrain(d))를 모델이 설명자 d를 사용하여 학습 데이터 전체 Strain에 대해 내는 0~1 손실로 정의하자. Ttrain(d)는 클래스 이름에 설명자 d를 덧붙여 텍스트 인코더로 계산한 라벨 텍스트 임베딩을 의미한다. 비전 모델의 모든 파라미터는 고정되어 있으므로, 표기에서는 이를 생략한다. 우리는 텍스트 임베딩 공간에서 중심을 이루는 m개의 설명자를 선택하여 0~1 손실을 최소화하려 한다.

여기서 m/1∑(i=1,m)Ttrain(di)는 각 클래스에 대한 텍스트 임베딩의 L2 정규화 중심을 나타낸다. 이 중심은 항상 정규화되며, 이미지 임베딩과의 코사인 유사도를 계산하는 데 사용된다.

위 식은 계산적으로 다루기 어려운 조합 최적화 문제이지만, 이를 greedy 접근법이나 연속적인 최적화를 통해 근사적으로 해결할 수 있다. 우리는 greedy 접근을 사용한다. 알고리즘은 다음과 같이 요약된다.

① 모든 d에 대해 ℓ(Strain, Ttrain(d))를 계산한다. 정확도가 높은 순서대로 정렬한다. 이 정렬된 리스트를 D = [d0, ..., dn]이라 하자.
② “descriptor soup” D를 최적의 설명자 d0으로 초기화한다. D = {d0}
③ i = 1~n까지 반복하며, di를 추가했을 때 D의 손실이 감소하면 di를 D에 추가한다.
④ D*에서 처음 m개의 설명자를 반환한다.

-Building Intuition
자연스러운 질문은 “이제 개별 클래스를 직접 설명하지 않는 설명자들이 왜 효과적인가?”일 것이다. 그 답은 두 가지이다.

① 알고리즘 1은 개별 레이블이 아니라 데이터셋 전체를 설명하는 설명자를 찾는다. 이는 분류 문제와 직접적이지는 않지만, 이미지와 텍스트 임베딩 간의 alignment을 증가시켜 정확도를 높인다.
② Descriptor soup은 타깃 분류 문제가 소스 분류 문제보다 범위가 좁을 때 일반화가 잘 된다. 예컨대, “a type of aircraft”나 “a type of pet” 같은 handcrafted dataset-specific descriptors는 zero-shot 정확도를 향상시키는 것으로 알려져 있다. 이러한 데이터셋 수준 설명자는 라벨 수준 설명자보다 설계하기 쉽기 때문에 현재는 표준적인 방식이다. 우리는 이러한 설명자들이 이미지와 텍스트 임베딩 간 정렬을 강화하기 때문에 정확도를 향상시킨다고 가정한다.

우리는 추가로 descriptor soup 구성원들이 handcrafted dataset-specific descriptors와 비슷한 역할을 한다고 가정한다. 이를 뒷받침하기 위해, 세 가지 다른 데이터셋으로 학습된 descriptor soup 예시를 표에 제시한다. 예를 들어 펫 데이터셋(분홍색)에서 학습된 설명자들은 “claws(발톱)”, “eyes(눈)”, “hair(털)” 등을 언급하며, 이는 대부분의 펫에 공통적인 개념이다. DTD 데이터셋(노란색)에서 학습된 설명자들은 “pattern(패턴)”, “logo(로고)”, “design(디자인)”을 언급한다. 반면, ImageNet은 더 광범위한 데이터셋이므로 ImageNet에서 학습된 설명자(파란색)는 대체로 비구체적이다(예: “which could be brown or grey”). 이는 직관적이다. 왜냐하면 ImageNet은 다양한 클래스를 포함하기 때문이다. 예컨대 “which is a type of dog” 같은 설명자는 zero-shot 정확도를 해칠 수 있는데, 이는 분류기를 개별 개 클래스에 편향시키기 때문이다. 표는 소스와 타깃 데이터셋이 동일할 때, 개별 descriptor soup 구성원들이 정렬도와 분류 정확도를 모두 향상시킴을 보여준다.

-Generalizability
ImageNet에서 학습된 descriptor soup은 범위가 더 좁은 타깃 데이터셋으로 일반화되지만, 그 반대는 성립하지 않는다. 이는 ImageNet의 개념이 더 좁은 타깃 데이터셋의 상위 집합이기 때문이다. 예를 들어, ImageNet 클래스에는 자동차와 펫 유형이 모두 포함된다. ImageNet에서 학습된 설명자(파란색)가 Pets와 Textures에서 정렬도와 정확도를 모두 향상시키는 반면, Pets(분홍색)와 Textures(노란색)에서 학습된 설명자들은 ImageNet에서는 두 지표 모두를 떨어뜨린다는 것을 보여준다. Descriptor soup의 일반화 가능성을 추가로 입증하기 위해, 우리는 ImageNet 정확도와 평균 타깃 데이터셋 정확도 사이의 양의 상관관계를 제시한다.

마지막으로, 우리는 10개 데이터셋의 평균 정확도를 최대화하도록 테스트 데이터에서 descriptor soup을 학습했으며, 이를 “descriptor soup upper bound”라 부른다. 그러나 upper bound는 ImageNet 학습 데이터에서 greedy하게 선택된 descriptor soup보다 미미한 개선만 보였다. 이는 ImageNet 학습 데이터에서 descriptor soup 정확도를 greedy하게 최대화하는 것이 타깃 정확도를 최대화하는 좋은 근사치임을 시사한다. 즉, 일반화 격차는 작다는 의미다.

ⓒ Word Soup
Descriptor soup은 인상적인 최신 성능을 달성하지만, 여전히 훈련 시 LLM에 의존해 후보 설명자들을 생성해야 하고, 이 고정된 설명자 목록에 제한된다. 이러한 LLM 의존성을 제거하고 최적화 과정을 더 유연하게 만들기 위해, 우리는 사전에 있는 개별 단어들을 선택해 greedy 방식으로 설명자를 생성하는 Word Soup을 제안한다. 후보 단어 풀로는 웹에서 가장 자주 쓰이는 10000개 영어 단어 목록을 사용한다.

n개의 단어 W = {w1,...,wn}가 주어졌을 때, 설명자는 길이가 p를 넘지 않는 한, 어떤 단어 시퀀스도 가능하다.

위 식로 정의된 word soup 문제는 계산적으로 불가능하므로, 우리는 근사적인 greedy 해법을 제안한다.

① 초기화: 단어 W를 zero-shot 정확도 기준으로 내림차순 정렬하여 부적절한 단어를 걸러낸다. 이 단계에서는 단일 단어 설명자만 고려한다. top-k0, top-k1 단어를 선택한다.
② Wtop-k0에서 무작위로 단어 w를 하나 골라 초기 설명자 d=w로 둔다.
③ Wtop-k1을 섞은 뒤, 각 단어 w′를 d에 붙였을 때 정확도가 올라가면 추가한다.
④ 위 과정을 반복하여 총 m개의 설명자를 얻는다.

우리는 초기화를 무작위로 하고 단어를 섞어 다양성을 확보한다. 또한, 설명자를 길이 p로 강제 자르지 않고, patience 파라미터를 도입하여 평균 길이를 간접적으로 제어한다.

-Motivation from descriptor soup
Descriptor soup 방법은 앞 절에서 다룬 직관적인 속성을 갖고 있지만, 좋은 설명자의 수가 적다는 한계가 있다.

x축: zero-shot 정확도를 기준으로 내림차순 정렬된 descriptor
y축: 각 방법의 zero-shot 정확도

그림은 집합 D 안에서 약 1200개의 설명자(초록색 선)만이 설명자를 사용하지 않은 경우보다 성능이 좋음을 보여준다. Descriptor soup은 이 1200개의 좋은 설명자들의 다양한 조합에 한정된다. 반대로, 가설 공간을 D′(단어 집합의 모든 순열)로 확장하면, 주황색 선이 보여주듯이 선택할 수 있는 좋은 설명자가 훨씬 더 많아진다. 다시 말해, word soup은 가설 집합의 크기를 키움으로써 분류 정확도를 향상시킨다.

ⓓ Diversity loss
Word soup은 이미 대부분의 벤치마크에서 경쟁력 있는 성능을 달성한다. 다음 단계로 자연스러운 방법은 word soup 설명자를 초기화 값으로 파인튜닝하는 것이다. CLIP의 few-shot 파인튜닝에는 CoOp, Clipood, MaPLe 등 다양한 방법이 존재한다. 그러나 실제로는 파인튜닝 후 타깃 정확도가 소폭 감소하는 경우가 많다. 이는 동일한 few-shot 데이터에서 모든 설명자를 파인튜닝하면 텍스트 프로토타입들이 임베딩 공간에서 같은 위치로 수렴하게 되어, 초기 다양성이 사라지기 때문이다. 고정된 word soup 설명자 D∗ = {d1∗,...,dm∗}가 주어졌을 때, 우리의 학습 손실은 다음과 같다.

CE: 교차 엔트로피 손실
y^di∗: 설명자 di∗를 사용한 모델의 soft 예측 확률 분포
ytruth: 정답 레이블의 one-hot 인코딩
y^di∗0: 초기 모델이 설명자 di∗로 만든 soft 예측 확률 분포
λ: 정규화 정도를 제어하는 하이퍼파라미터

y^di∗가 최적화되는 값이며, y^di∗0는 소프트맥스에 teacher temperature τ0를 적용한 출력이다. 고전적 지식 증류에서처럼, 교사 온도와 학습 온도를 다르게 설정하는 것이 유용하다.

우리의 학습 손실은 모델이 각 설명자를 사용할 때 초기 모델의 예측 쪽으로 치우치도록 유도하여, 초기화 시점에서 존재하던 예측의 다양성을 유지한다. λ = 0.25로 학습했을 때, 설명자 예측 y^d*i들 사이의 평균 KL 발산이 더 높아지고, 낮은 λ 값으로 학습했을 때보다 평균 타깃 정확도도 더 높아진다. 학습은 모든 설명자에 대해 하나의 모델만 학습하기 때문에, 표준 교차 엔트로피 학습보다 오래 걸리지 않는다. 설명자 토큰들은 고정된다.

Results
우리는 주요 few-shot 결과를 제시한다. 본 장의 목표는 OOD 환경에서 다음을 입증하는 것이다.

① 기존 few-shot 방법과의 보완성
Descriptor soup 또는 word soup을 전통적인 파인튜닝 기법에 추가로 적용하면 타깃 정확도가 향상되며, 현재 발표된 state-of-the-art를 초과한다.

② 매개변수 효율성
Word soup은 이산적 토큰을 사용하기 때문에 CoOp보다 매개변수 효율성이 높다. 또한 우리는 VPT, bitfit, CLIP-adapter, SSF, LoRA, adapter 등 다른 PEFT(Parameter-Efficient Fine-Tuning) 방법과 비교한다.

③ Descriptor 효율성
단 1개 또는 2개의 descriptor만으로도 기존의 최신 zero-shot 방법을 능가한다. 따라서 일부 기존 방법과 달리, 본 연구의 성능 향상은 주로 앙상블링에 의해 발생하지 않는다.

ⓐ Datasets
훈련은 무작위로 선택된 ImageNet-1K의 16-shot 분할에서 진행되었으며, 테스트는 14개의 보지 못한 target 데이터셋에서 수행되었다: Caltech-101, Oxford-Pets, Stanford-Cars, Flowers-102, Food-101, FGVC-Aircraft, SUN-397, Describable-Textures(DTD), EuroSAT, UCF-101, ImageNet-V2, ImageNet-Sketch, ImageNet-A, ImageNet-R.
마지막 네 데이터셋은 ImageNet의 라벨 공간을 유지하면서 도메인 변화가 적용된 버전이다.

ⓑ Experimental Setting
모든 baseline과 방법들은 16-shot ImageNet-1K 데이터로 훈련되었으며, 지정된 target 데이터셋에서 테스트되었다.
하이퍼파라미터들은 별도로 확보한 검증 세트에서 조정하였다.

ⓒ Discussion
우리의 word soup 방법을 CE, CoOp, MaPLe, CLIPood (CLIP 기본 모델들) 위에 결합하면 XD 및 DG 벤치마크 모두에서 평균 타깃 정확도가 약 0.8~1.0% 향상된다.

Greedy descriptor soup은 우리의 token offset trick을 사용해 보완될 수 있는데, 이는 각 descriptor를 6개의 증강된 복사본으로 확장하는 방식이다. Token offset trick은 XD에서 0.4%, DG에서 0.3% 정확도 향상을 가져오지만, 상당한 계산 비용이 따른다. 반면, greedy word soup은 이러한 추가 계산 비용 없이도 증강된 descriptor soup과 유사한 성능을 달성한다.

결론적으로, 최고의 OOD 정확도는 token offset이 적용된 descriptor soup이나 word soup에서 얻어졌다.

  • Ablation Study
    우리의 soup 방법에 대해, 다양한 m값을 사용한 ablation study 결과를 제시한다. 두 벤치마크 모두에서, word soup은 모든 m에서 가장 우수한 성능을 보였다. 특히 m=2 일 때부터 m=64까지 모든 경우에서 모든 zero-shot baseline을 능가하였다. 이 결과는, 기존 최신 zero-shot 방법들과는 달리, 우리 방법의 핵심은 단순한 앙상블링이 아님을 보여준다.

Conclusion
본 논문에서는 cross-dataset 및 domain generalization 문제를 해결하기 위해 descriptor soup과 word soup을 제안하였다.

Descriptor soup은 소스 데이터셋에서 훈련 정확도를 극대화하는 방식으로 descriptor 집합을 greedy하게 선택한다. Word soup은 유사한 greedy 절차를 통해 단어들을 연결하여 생성된다. 이러한 greedy soup 방법들은 훈련 정확도를 명시적으로 최대화함으로써, 기존 descriptor 기반 방법들보다 더 높은 타깃 분류 정확도를 달성한다.

또한 우리는 word soup의 다양성을 파인튜닝 과정 내내 유지하기 위한 손실 함수를 제안하였다. Word soup을 초기화에 사용하고, diversity loss와 함께 파인튜닝을 수행하면 기존 few-shot OOD 파인튜닝 방법들의 정확도를 크게 향상시킬 수 있다.

모든 baseline과 비교했을 때, word soup은 매개변수 효율성과 타깃 정확도 간의 최적의 균형을 달성하였다.

profile
김준형

0개의 댓글