1 of 12

Автоматический синтез речи. Нейросетевой синтез

​

​

​

​

​

​

П. А. Холявин

​

p.kholyavin@spbu.ru

​

​

​

22.04.2024

1

2 of 12

Структура

​

1. Модуль текстового анализа

​

2. Акустическая модель

​

3. Вокодер

​

2

3 of 12

Акустические модели

​

На входе – последовательности букв или “фонем”

​

На выходе – акустические признаки высокой размерности (например, мел-спектрограммы)

​

Архитектура:

1. RNN

2. CNN

3. Трансформеры

​

3

4 of 12

RNN: Tacotron

​

4

5 of 12

Алгоритм Гриффина-Лима

​

5

6 of 12

LSTM: Tacotron 2

​

6

7 of 12

Вокодер WaveNet

​

7

8 of 12

CNN: DeepVoice 3

​

8

9 of 12

Transformer: FastSpeech

​

9

10 of 12

Transformer: FastSpeech 2

​

10

11 of 12

End-to-End модели

​

1) Совместное обучение акустической модели и вокодера

​

Char2Wav, Clarinet

​

2) Полностью параллельная структура

​

FastSpeech 2s, VITS

​

11

12 of 12

Спасибо за внимание!

12