음성인식 수행 과정
1. Domain Knowledge를 활용하여 Handcraft Feature 생성
2. Handcraft Feature를 이용하여 Acoustic Model 개발
Self-supervised Learning
음성 데이터만으로 (텍스트X) 음성의 특징을 잘 추출할 수 있는 모델을 개발
unlabeled 데이터로부터 일반적인 데이터 표현을 학습한 다음, labeled 데이터에서 모델을 세밀하게 조정
labeled 데이터의 양을 크게 줄이고, 다양한 언어 및 환경에서 음성 인식의 정확도를 높이는 데 도움이 됨

Feature Encoder
발화 데이터 → latent represenation로 임베딩
Transformer
Positional Encoding
→ convolution layer로 대체, layer normalization 적용
Quantization module
Vector Quantization : Z를 선형변환하여 logit
→ one-hot vector로 생성
→ embedding matrix 내적
Masking
일정 비율(p)의 time step을 무작위로 선택하여 일련의 연속적인 시간 범위를 가리는 방식
Objective
Contrastive task()를 통해 masked time step을 다른 대상들과 구별하여 음성 표현을 학습
diversity loss()를 통해 codebook entry의 균형


wav2vec 2.0은 레이블이 없는 데이터로 사전 훈련하여 레이블 데이터가 매우 제한적인 상황에서 뛰어난 성과를 보인다. 예를 들어, 단 10분의 레이블된 데이터만 사용하여 Librispeech 테스트에서 우수한 결과를 달성하며, 더 많은 레이블 데이터를 사용한 기존 방식보다 100배 적은 양의 레이블 데이터로 이전의 최고 성과를 뛰어넘는 것으로 나타났다.