[논문 리뷰] Multi-modal emotion recognition in conversation based on prompt learning with text-audio fusion features

shardone·2026년 2월 27일

논문 리뷰 📜

목록 보기
5/5

👉🏻 논문 링크

데이터셋

기존 연구 문제점

  • 기존 ERC 방법들은 구조화된 데이터를 통합해 인식 정확도를 높였지만, 언어 장벽과 비영어권 자원 부족으로 인해 다국어 적용에 한계가 있었다.
  • 전통 모델이 프롬프트 정보를 활용하기 어렵다. 사전학습 모델의 강력한 지식을 ERC에 효과적으로 연결하는 방법이 부족했다.
  • 긴 대화에서 정보 손실 없이 시퀀스를 처리하는 것이 어렵다.
  • 유사 감정에서 변별적 특징 학습이 부족하다.

MERC-PLTAF의 목적

  • 음성 모달 융합: OpenSmile로 추출한 low-level 음성 특징을 보조 모달로 활용해 감정 인식의 정보 차원을 확장한다.
  • 새로운 프롬프트 학습 전략: 텍스트 프롬프트 템플릿과 음성 프롬프트 템플릿을 동시에 설계해 사전학습 모델이 감정의 의미를 더 깊이 이해하도록 한다.
  • TCN(Temporal Convolutional Network) 기반 긴 시퀀스 처리: TCN를 도입해 영어·중국어 혼재 데이터와 긴 시퀀스를 데이터 손실 없이 효율적으로 처리한다.
  • Contrastive Learning: 유사 감정 사이의 변별력을 높이도록 한다.
  • 다국어 검증: 영어(IEMOCAP, MELD)와 중국어(M3ED) 데이터셋에서 모두 실험해 범용성을 입증한다.

모델 구조

입력 데이터
    ↓
[1] Prompt 구성: 텍스트 프롬프트 + 음성 프롬프트 템플릿 생성
    ↓
[2] 특징 추출: 텍스트 → BERT/SimCSE, 음성 → OpenSmile (IS10, 1582차원)
    ↓
[3] 차원 정렬: 음성 특징을 Linear 변환으로 텍스트와 동일 차원(1024)으로 맞춤
    ↓
[4] 특징 상호작용: CrossAttention (A→T, T→A 양방향)
    ↓
[5] TCN 시퀀스 학습 → Decision-level Fusion → 최종 감정 예측

Prompt Learning Encoding

사전학습 모델이 ERC 태스크에 최적으로 적응하도록 텍스트와 음성 두 종류의 프롬프트 템플릿을 설계해 입력에 추가하는 단계이다

텍스트 프롬프트
현재 발화 직전 k개의 이전 발화들을 맥락으로 넣고, 현재 발화에 대한 프롬프트를 붙인다.

음성 프롬프트
OpenSmile로 추출한 저수준 음성 특성(말속도, 피치, 강도)을 자연어 텍스트로 변환해 프롬프트에 포함한다. 예를 들어 말속도가 4.5 이상이면 "faster pace"라는 표현이 프롬프트에 들어간다.

Audio Feature Extraction

OpenSmile의 IS10 특징 세트를 사용해 1,582차원의 low-level 음성 특성을 추출한다. 텍스트 인코더 출력(1024차원)과 차원이 다르기 때문에 Linear 변환으로 1024차원으로 맞춘다.

Feature Interaction Layer — CrossAttention

음성이 텍스트 정보를 참조하고(A→T), 텍스트가 음성 정보를 참조하는(T→A) 양방향 크로스 어텐션으로 두 모달의 상보적 정보를 교환하는 단계이다,

각 모달 히든 스테이트를 Query, Key, Value로 선형 변환한 뒤 멀티헤드 크로스 어텐션을 수행한다.

  • A→T 방향: 음성(Q)이 텍스트(K, V)를 참조, 음성이 텍스트 맥락 정보를 흡수
  • T→A 방향: 텍스트(Q)가 음성(K, V)를 참조, 텍스트가 음성 감정 정보를 흡수

어텐션 이후 Residual Connection과 LayerNorm을 적용해 원래 모달 정보를 보존하면서 상호 보완 정보를 융합한다. 이렇게 얻은 두 개의 크로스모달 표현이 다음 단계로 전달된다.

TCN (Temporal Convolutional Network)

Causal Convolution과 Dilated Convolution 조합으로 인과적 시간 순서를 유지하면서 긴 범위 의존성을 효율적으로 포착하는 시퀀스 모델이다.

Causal Convolution: 현재 시점의 출력이 과거와 현재 입력에만 의존하므로 미래 정보 누출이 없다. ERC처럼 시간 순서가 중요한 태스크에 적합하다.

Dilated Convolution: 컨볼루션 커널에 dilation을 두어 계산량을 늘리지 않고도 긴 범위 의존성을 포착한다.

RNN/LSTM에 비해 병렬 계산이 가능하고 긴 시퀀스에서 정보 손실(기울기 소실)이 적다는 장점이 있다.

Decision-level Fusion

TCN을 통과한 두 표현(RA→T 경로, RT→A 경로)을 각각 독립적으로 감정 예측에 사용한 뒤, 두 예측 결과를 Decision-level에서 융합해 최종 감정 레이블을 결정한다. 이 방식은 각 모달이 독립적인 판단 능력을 유지하면서 최종 단계에서만 결합되록 한다.

Conclusion

  • 유사 감정 쌍인 "Excited & Happy", "Frustrated & Angry" 구분력이 크게 향상됐다. 이는 음성 프롬프트가 감정 뉘앙스 구별에 효과적임을 보여준다.
  • 중국어 데이터셋에서도 모든 지표에서 SOTA를 달성하여, 다국어 범용성을 입증해내었다.
  • 긴 시퀀스 모델링이 핵심
  • 음성 프롬프트 제거가 텍스트 프롬프트 제거보다 더 큰 성능 하락을 일으키므로, 음성 특성을 자연어 프롬프트로 변환하는 아이디어가 특히 효과적이라고 할 수 있다.
  • 음성 모달 자체 제거와 음성 프롬프트 제거 효과가 비슷한 수준이므로, 두 방식이 서로 보완적임을 알 수 있다.

한계점

감정 경계가 모호하거나 여러 감정이 혼재된 복잡한 표현에서는 여전히 인식 오류가 발생한다. 또한, 영상이나 생리 신호 등 다른 모달은 아직 통합되지 않았다는 한계가 존재한다. 앞으로는 복잡한 감정의 미묘한 차이를 더 잘 포착하는 방법과, 영상 등의 추가 모달 정보 통합하는 방법을 연구할 필요가 있다. 감정을 유발하거나 영향을 미치는 요인을 모델링하는 방법도 고안될 필요가 있다.

profile
data scientist

0개의 댓글