🔴 논문
- 제목 : Cross-modal distillation with audio–text fusion for fine-grained emotion classification using BERT and Wav2vec 2.0
- 저널/년도 : Neurocomputing/2022
🟠 1. Introduction
- fine-grained emotion classification (세분화된 감정분류) : 텍스트 감정레이블을 기쁨, 분노, 슬픔, 중립과 같이 세분화하여 인간의 감정을 잘 이해하는 것이 목표임
- 감정레이블 : 사람의 의도 및 기분과 관련 특성을 포함하고 있음
- affective computing (감정 컴퓨팅 분야) : 세분화된 감정 분류를 이용하여 신체적 특성 감지, 이를 생체인식센서 등을 컴퓨터 기술에 적용하는 연구활발히 진행중
- 일반적인 음성인식이 아닌, 사람의 세밀한 감정 표현을 포함하는 감정+음성에 대한 연구가 활발히 진행되고 있음
- AI 스피커, IoT 등 다양한 응용 서비스에 적용될 수 있어 세분화된 감정분류에 대한 연구는 매우 중요함 (+요즘에는 자율주행차에도 땀, 음성 등을 적용하려고 함><)
- 감정분석의 기존 연구에서는 주로 텍스트를 사용하였으나, 세분화된 감정을 분류하기 위해서는 텍스트 외에 추가적인 정보가 필요함
- (1) 감정표현에 따라 말의 억양이 달라짐
- ex. "아주 좋아. 잘했어." ---> 긍정이 아닌, 부정의 의미로 비꼬는 말일 수 있음
- (2) 짧은 문장의 감정을 분류 할 때, 텍스트 문맥 정보가 부족하여 감정분류에 모호성이 있을 수 있음 ---> 단답형 문항에서 텍스트 양식만으로는 감정을 정확하게 판단하기 어렵다
- ex. "네", "응. 그래"
- 이에 따라, 텍스트 + 오디오 신호를 추가적으로 고려한
오디오-텍스트융합 연구가 이루어짐- (Representation learning)
오디오-텍스트--> 다양한 정보를 활용함으로써, 세분화된 감정분류에 효과적임- 그러나,
오디오-텍스트로 구성된 쌍 데이터 세트의 수집은 어렵고, 데이터 양도 부족하여오디오-텍스트의 특성 및 관계를 학습하기 어려움- 이를 해결하기 위한 이전 연구 방법은 3가지가 있음
- (1) semi-supervised learning (Semi-SL)
: 레이블이 지정되지 않은 데이터가 많은 경우, 분류 성능을 향상 시키는 목적
: (i) pretraining and (ii) fine-tuning 두 단계 포함
➡ 다중 모달 데이터 세트에 대해 여러 개의 사전 훈련된 대규모 모델을 동시에 미세 조정하는 데 확장성과 메모리 효율성이 충분하지 않음
➡ 이를 해결하기 위해 본 연구에서 제안한 방법cross-modal distillation (CMD)
🟡 cross-modal distillation (CMD)
- CMD 란?
: 음향 정보와 텍스트 정보 간의 교차 양식 상호 작용을 학습
: 몇 가지 매개변수로 구성된 학생 모델 특징 공간이 각 양식의 특징을 적절하게 나타내는 교사 모델 특징 공간과 유사하도록 대조 학습을 실행
: 오디오-텍스트 융합을 위한 표현을 향상시키기 위해 두 가지 어텐션 메커니즘 (오디오-텍스트 크로스-어텐션 및 셀프-어텐션)이 실행- 본 연구에서 제안하는 방법의 2가지 단계
(1) 증류단계
: 학생 모델이 업데이트되어 몇 가지 매개변수가 있는 학생 모델(오디오-텍스트 변환기)의 특징 벡터가 Wav2vec 2.0 및 BERT(교사 모델)의 특징 벡터와 유사해짐
: 오디오 및 텍스트에 각각 Self-SL을 사용하여 적절하게 훈련시킴
: 훈련 과정에서 오디오-텍스트 변환기는 교차주의와 셀프어텐션을 순차적으로 거쳐 오디오-텍스트 융합을 진행
: 증류 단계에서 사용되는 교차 주의는 후속 미세 조정 단계에서 다중 클래스 감정 분류를 위해 오디오와 텍스트 간의 관계 및 정렬을 사전 학습
(2) 미세조정단계
: 오디오-텍스트 변환기(학생 모델)를 사용하여 재훈련
: 모델 매개변수는 기능이 감정 레이블을 효과적으로 분류할 수 있도록 업데이트됨
🟡 Contributions
- 사전 학습 단계에서 음향 정보와 텍스트 정보 간의 교차 양식 상호 작용을 학습하기 위해 경량 모델을 사용하여 지식 증류를 제안
- 오디오-텍스트 융합을 위한 표현을 향상시키기 위해 증류 단계에서 실행되는 두 가지 주의 메커니즘(오디오-텍스트 교차 주의 및 자기 주의)을 사용
- 제안한 경량 모델은 EMOCAP, MELD 및 CMU-MOSEI 데이터 세트에 대한 다중 클래스 감정 분류 작업에서 예측에 대한 불확실성이 상당히 낮은 벤치마크 모델보다 성능이 뛰어남
🟢 2. Literature review
- 학습 레이블이 불충분한 다중 모드 데이터 세트를 사용하여 다중 클래스 감정 분류 성능을 개선하는 방법 : (1) Semi SL: self-training(ST)/co-training(CT), (2) Self-SL, (3) 지식 증류
- 여기서, 중점적으로 지식증류 방법을 설명하고자 함
- (3) 지식 증류의 3가지 측면
- (a) response-based knowledge
: 이미 잘 훈련된 선생 네트워크의 출력(soft-max) 계층을 훈련 중인 학생 네트워크의 출력 계층으로 전달
: 이 접근법의 목적 함수는 학생 네트워크와 교사 네트워크에서 계산된 대상 클래스의 두 분포 간의 차이를 기반으로 계산- (b) feature-based knowledge
: 학생 네트워크와 교사 네트워크에서 계산된 두 특징 벡터 간의 차이를 최소화하도록 훈련되며, mean squared error (MSE)는 일반적으로 손실 함수로 사용- (c) relation-based knowledge
: 훈련 데이터에 사용된 관찰 사이의 유사성을 보존
🔵 ### 3. Method : cross-modal distillation (CMD)
CMD아키텍처 [그림 1]은 다음과 같다- contextual embeddings 증류 방법은 두 개의 교사-학생 벡터 사이의 유사성을 최대화하기 위해 contrastive(대조학습)을 채택하는 것을 포함
- 모델은 audio–text transformers 간의 attention-based audio–text fusion(융합)이 가능하도록 설계
CMD는 매개변수가 적은 모델을 기반으로 오디오와 텍스트 간의 문맥 표현 개선에 기여 할 수 있음- 학생 모델이 다운스트림 작업에서 미세 조정된다면 감정 인식의 성능 향상을 달성할 수 있음
- audio–text transformers는 2단계 attention 모듈로 구성
: 첫 번째 모듈에서 오디오와 텍스트 간의 cross-attention 방법은 자체 모달리티에서 쿼리 벡터를 생성한 다음 다른 참조 모달리티에서 키 및 값 벡터를 수신하여 multi-head attention를 수행
- [그림 2]는 Attention mechanism - transformer encoder를 보여줌
🔵 ### 3. Method : Teacher model
- (1) BERT [그림 3]
: transformer encoders를 사용하여 next sentence prediction (NSP)를 포함하여 문장에서 마스크된 단어(토큰)를 예측하는 mask language modeling (MLM)을 훈련
- (2) Wav2vec 2.0 [그림 4]
- (a) Contrastive task
: 대조 학습이 실행되어 특정 위치에 임베딩된 마스킹된 입력이 동일한 위치의 진정한 마스킹되지 않은 특징(양성 샘플)을 끌어당기도록 훈련되고 다른 마스킹된 시간 단계에 위치한 마스킹되지 않은 특징(음성 샘플)을 밀어냄- (b) Quantization task
: 마스킹된 시간 단계에서 진정한 마스킹되지 않은 기능은 양자화 모듈의 argmax 함수로 적용되고 이산 공간으로 표현
: 이 과정에서 양자화의 다양성을 확보하기 위해 평균화된 softmax 분포의 엔트로피를 최대화하여 주어진 unmasked 특징들이 이산 공간에 고르게 분포
: Wav2vec 2.0의 입력 임베딩은 각 블록의 입력 데이터가 1D 컨볼루션, LayerNorm 및 GELU 활성화 함수로 순차적으로 적용되는 여러 블록으로 구성
🔵 ### 3. Method : Student model
Contrastive learning에서 영감을 얻은 제안된CMD는 가중치가 고정된 Wav2vec 2.0 및 BERT(teacher 모델)에서 컨텍스트 임베딩을 추출한 다음 offline distillation를 수행하여 오디오-텍스트 변환기(student 모델)에 컨텍스트 정보를 전달
🔵 ### 3. Method : Cross-modal distillation
🔸 Feature-based distillation with audio–text fusion
🟣 ### 4. Experiments
🔸 Data description
- 사용한 데이터셋 : IEMOCAP dataset (영어 데이터셋, https://paperswithcode.com/dataset/iemocap)
- 감정레이블(4 classes) : happiness (행복), anger (분노), sadness (슬픔), neutral (중립)
- train (60%), validation (20%), test (20%)
⭐ 기존 transformer는 cross attention을 하지 않는데, 본 논문에서는 cross attention을 한다는 점이 중요한거 같음
® [논문저자] 논문에 대한 코드는 공개하지 않았지만, 감정 데이터셋에 대한 일부 정보는 공개한 것 같아서 깃 주소를 올림
® https://github.com/Donghwa-KIM/emotion-datasets
® https://github.com/Donghwa-KIM/audiotext-transformer
® https://github.com/Donghwa-KIM/audiotext-transformer/blob/master/model.py