[논문 리뷰] wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations

Diddu·2023년 10월 16일

🔎 논문 리뷰

목록 보기
9/12

💡 wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations_논문 리뷰



📌 Background

음성인식 수행 과정
1. Domain Knowledge를 활용하여 Handcraft Feature 생성
2. Handcraft Feature를 이용하여 Acoustic Model 개발

Self-supervised Learning
음성 데이터만으로 (텍스트X) 음성의 특징을 잘 추출할 수 있는 모델을 개발
unlabeled 데이터로부터 일반적인 데이터 표현을 학습한 다음, labeled 데이터에서 모델을 세밀하게 조정
labeled 데이터의 양을 크게 줄이고, 다양한 언어 및 환경에서 음성 인식의 정확도를 높이는 데 도움이 됨




📌 Model

  • Feature Encoder
    발화 데이터 → latent represenation로 임베딩

  • Transformer
    Positional Encoding
    → convolution layer로 대체, layer normalization 적용

  • Quantization module
    Vector Quantization : Z를 선형변환하여 logit
    → one-hot vector로 생성
    → embedding matrix 내적




📌 Training

  • Masking
    일정 비율(p)의 time step을 무작위로 선택하여 일련의 연속적인 시간 범위를 가리는 방식

  • Objective
    Contrastive task(LmL_m)를 통해 masked time step을 다른 대상들과 구별하여 음성 표현을 학습
    diversity loss(LdL_d)를 통해 codebook entry의 균형


  • Fine-tuning




📌 Conclusion

wav2vec 2.0은 레이블이 없는 데이터로 사전 훈련하여 레이블 데이터가 매우 제한적인 상황에서 뛰어난 성과를 보인다. 예를 들어, 단 10분의 레이블된 데이터만 사용하여 Librispeech 테스트에서 우수한 결과를 달성하며, 더 많은 레이블 데이터를 사용한 기존 방식보다 100배 적은 양의 레이블 데이터로 이전의 최고 성과를 뛰어넘는 것으로 나타났다.

0개의 댓글