2022.08.11
제네시스랩 신재영
ICLR 2020
Previous Work
Wav2Vec
CNN 기반으로 speech data 자체의 general representation 학습
Contrastive Predictive Coding(CPC) 적용:
음성 내에 전반적으로 공유정보가 존재하며 이를 추출하는 것을 목표로 학습
Context network :
encoder network를 거쳐서 나온 Z를 context representation C로 변환
Encoder network : raw waveform X를 latent space에 embedding하여 latent representation 로 변환
CNN
Input : raw audio data
Output : Speech Recognition System에 적용가능한 audio의 representation
Background
BERT pre-training schema(Masked Language Model)
MLM과 Tansformer Encoder 아키텍처를 활용한 Pre-training 방법론이 Sequence 안의 패턴을 잘 추출
(BERT 파생 모델들에서 공통적으로 나타나는 특징)
VQ-wav2vec 의 목표
→ Sequence 안에 패턴을 잘 추출하는 MLM 방법론을 활용하여 음성 인식의 성능 향상�
→ BERT pre-training 방법론을 활용하기 위한 조건에 주목
VQ-Wav2Vec Overview
VQ-Wav2vec 목표
�Wav2vec 모델의 출력을 이산 형태로 변환
↓
BERT의 MLM pre-training 방법을 적용
↓
Wav2Vec 모델의 CPC 방법으로 학습하기 위한 모듈(q) 추가 (Gumbel-Softmax,
K-means Clustering 활용)
↓
음성인식의 성능 향상
Vector Quantization module
Gumbel-Softmax : 미분이 가능한 Sampling 기법
→ 도출된 Discrete one-hot Vector에 Embedding matrix를 벡터곱하여 다시 Continuous Vector를 생성
Vector Quantization module
K-means : 미분이 가능한 Sampling 기법
Experiments
• Dataset : WSJ dataset, TIMIT dataset
• 결론:
→ BERT와 같이 다른 NLP모델과의 hybrid 하는 경우는 VQ-wav2vec이 효과적
THANK YOU �FOR LISTENING