Автоматический синтез речи. Нейросетевой синтез
П. А. Холявин
p.kholyavin@spbu.ru
22.04.2024
1
Структура
1. Модуль текстового анализа
2. Акустическая модель
3. Вокодер
2
Акустические модели
На входе – последовательности букв или “фонем”
На выходе – акустические признаки высокой размерности (например, мел-спектрограммы)
Архитектура:
1. RNN
2. CNN
3. Трансформеры
3
RNN: Tacotron
4
Алгоритм Гриффина-Лима
5
LSTM: Tacotron 2
6
Вокодер WaveNet
7
CNN: DeepVoice 3
8
Transformer: FastSpeech
9
Transformer: FastSpeech 2
10
End-to-End модели
1) Совместное обучение акустической модели и вокодера
Char2Wav, Clarinet
2) Полностью параллельная структура
FastSpeech 2s, VITS
11
Спасибо за внимание!
12