2022.07.28
제네시스랩 신재영
Previous Work
CPC (Constrative Predictive Architecture)
Self-supervised 구조
Encoder(CNN) : 일정 길이의 음성을 latent vector로 변환
Aggregator(RNN) : latent vector를 context vector로 변환
장점
음성 데이터만으로 음성 안의 context vector 추출할 수 있는
방법 제시
음성 뿐 아니라 다양한 Task에 해당 방법론 적용 가능
단점
(속도) Aggregator가 RNN 계열이므로 병렬처리 불가
(성능) 음성 Task에서 다소 아쉬운 성능
음성 Self-Supervised Learning 목표
음성 데이터만으로 음성 안의 Context Vector (c)를 추출할 수 있는 모델
CNN
wav2vec Overview
CNN 기반으로 speech data 자체의 general representation 학습
Input : raw audio data
Output : Speech Recognition System에 적용가능한 audio의 general representation
학습 방식
Negative sample 사이에서 positive sample을 뽑는 Negative sampling 방식으로 진행
등장할 오디오 데이터를 예측하는 문제를 풀며 representation 학습
기존 CPC 연구와의 차이
(기존) Phoneme classification을 위해서 frame-wise로 오디오 데이터를 봄
(wav2vec) 바로 latent representation 을 활용해서 ASR 시스템에 적용. CNN 기반 구조라서 병렬처리 가능
wav2vec Architecture
Encoder network : raw waveform X를 latent space에 embedding하여 latent representation 로 변환
Context network : encoder network를 거쳐서 나온 Z를 contextualized tensor C로 매핑
wav2vec Architecture
Causal CNN : 특정 시점 이전의 정보만을 참조하여 CNN에 적용하는 방식
Causal CNN을 stacking하여 사용하면 RNN과 비슷한 효과
→ aggregator로 사용하며 병렬처리 가능하게 하여 속도 향상
Loss function
Negative Sampling
Experiments
ASR Task
Metric : WER(Word Error Rate), LER(Letter Error Rate)
Data : TIMIT, WSJ, Librispeech
(sampling rate: 16kHz, English)
Results
Pre-trained model 을 사용했을 때,
pre-trained model 에 사용되는 데이터가 많을수록 성능 좋음
THANK YOU �FOR LISTENING