1 of 12

Автоматический синтез речи. Нейросетевой синтез

П. А. Холявин

p.kholyavin@spbu.ru

22.04.2024

1

2 of 12

Структура

1. Модуль текстового анализа

2. Акустическая модель

3. Вокодер

2

3 of 12

Акустические модели

На входе – последовательности букв или “фонем”

На выходе – акустические признаки высокой размерности (например, мел-спектрограммы)

Архитектура:

1. RNN

2. CNN

3. Трансформеры

3

4 of 12

RNN: Tacotron

4

5 of 12

Алгоритм Гриффина-Лима

5

6 of 12

LSTM: Tacotron 2

6

7 of 12

Вокодер WaveNet

7

8 of 12

CNN: DeepVoice 3

8

9 of 12

Transformer: FastSpeech

9

10 of 12

Transformer: FastSpeech 2

10

11 of 12

End-to-End модели

1) Совместное обучение акустической модели и вокодера

Char2Wav, Clarinet

2) Полностью параллельная структура

FastSpeech 2s, VITS

11

12 of 12

Спасибо за внимание!

12