1 of 8

2022.08.11

제네시스랩 신재영

ICLR 2020

2 of 8

Previous Work

Wav2Vec

CNN 기반으로 speech data 자체의 general representation 학습

Contrastive Predictive Coding(CPC) 적용:

음성 내에 전반적으로 공유정보가 존재하며 이를 추출하는 것을 목표로 학습

Context network :

encoder network를 거쳐서 나온 Z를 context representation C로 변환

Encoder network : raw waveform X를 latent space에 embedding하여 latent representation 로 변환

CNN

Input : raw audio data

Output : Speech Recognition System에 적용가능한 audio의 representation

3 of 8

Background

BERT pre-training schema(Masked Language Model)

MLM과 Tansformer Encoder 아키텍처를 활용한 Pre-training 방법론이 Sequence 안의 패턴을 잘 추출

(BERT 파생 모델들에서 공통적으로 나타나는 특징)

VQ-wav2vec 의 목표

→ Sequence 안에 패턴을 잘 추출하는 MLM 방법론을 활용하여 음성 인식의 성능 향상�

→ BERT pre-training 방법론을 활용하기 위한 조건에 주목

    • Sequence 형태의 입력이어야 함
    • 이산(discrete) 형태의 입력이어야

4 of 8

VQ-Wav2Vec Overview

VQ-Wav2vec 목표

�Wav2vec 모델의 출력을 이산 형태로 변환

BERT의 MLM pre-training 방법을 적용

Wav2Vec 모델의 CPC 방법으로 학습하기 위한 모듈(q) 추가 (Gumbel-Softmax,

K-means Clustering 활용)

음성인식의 성능 향상

5 of 8

Vector Quantization module

Gumbel-Softmax : 미분이 가능한 Sampling 기법

  • Uniform(0, 1) 분포에서 Sampling한 후 𝑙𝑜𝑔 함수를 적용한 Noise를 logit에 더함
  • Softmax를 활용하여 각 element의 확률을 도출
  • Temperature를 활용하여 Discrete representation으로 근사

→ 도출된 Discrete one-hot Vector에 Embedding matrix를 벡터곱하여 다시 Continuous Vector를 생성

6 of 8

Vector Quantization module

K-means : 미분이 가능한 Sampling 기법

  • Embedding(Codebook)에서 거리가 가장 가까운 index 탐색

  • 해당 Embedding을 활용하여 CPC 진행

  • Gradient가 흐를 수 있도록 Trick을 사용
  • (Gumbel-Softmax와 동일)

7 of 8

Experiments

Dataset : WSJ dataset, TIMIT dataset

결론:

  1. Discrete Speech Representation이 효과적
  2. Gumbel Softmax가 K-means보다 효과적�

  • 한계 : Wav2vec을 사용하는 것보다 �VQ-Wav2vec + BERT 가 성능이 좋으나, vanilla일 경우는 Gumbel Softmax와 k-means 모두 wav2vec이 더 좋음�

→ BERT와 같이 다른 NLP모델과의 hybrid 하는 경우는 VQ-wav2vec이 효과적

8 of 8

THANK YOU �FOR LISTENING