Нейросинтез речи с использованием трансформерной сети

Neural Speech Synthesis with Transformer Network
Shujie Liu, Ming Liu, Naihan Li, Yanqing Liu, Sheng Zhao
2019-07-17

трансформерная TTSвокодер WaveNetмел-спектрограммымногоцелевая самовнимательностьсинтез речи из текста
Несмотря на то что были предложены сквозные нейронные методы синтеза речи из текста (TTS), такие как Tacotron2, и они демонстрируют результаты, соответствующие передовому уровню, им по-прежнему присущи две проблемы: (1) низкая эффективность обучения и вывода; (2) сложность моделирования дальних зависимостей с помощью современных рекуррентных нейронных сетей (RNN). Вдохновившись успехом трансформерных сетей в нейронном машинном переводе (NMT), в данной работе мы внедряем и адаптируем механизм многоголового внимания, заменяя им рекуррентные структуры, а также исходный механизм внимания в Tacotron2. Благодаря многоголовому самомножественному вниманию скрытые состояния кодировщика и декодировщика формируются параллельно, что повышает эффективность обучения. Кроме того, любые два входных элемента, относящиеся к различным временным шагам, напрямую связываются посредством механизма самомножественного внимания, что эффективно решает проблему дальних зависимостей. Используя последовательности фонем в качестве входных данных, наша трансформерная TTS-сеть генерирует мел-спектрограммы, которые затем обрабатываются вокодером WaveNet для получения итогового аудиосигнала. Для оценки эффективности и производительности предложенной сети проведены эксперименты. С точки зрения эффективности наша трансформерная TTS-сеть ускоряет обучение примерно в 4,25 раза по сравнению с Tacotron2. С точки зрения производительности строгие оценки с участием людей показывают, что предложенная модель достигает результатов, соответствующих передовому уровню, превосходя Tacotron2 на 0,048, и очень близка к качеству человеческой речи (4,39 против 4,44 по средней оценке мнений, MOS).
1
Человеческие оценки показывают результаты уровня state of the art: модель превосходит Tacotron2 на 0,048 и приближается к человеческому качеству, получая MOS 4,39 против 4,44.
2
Параллельные вычисления в энкодере и декодере повышают эффективность обучения: оно примерно в 4,25 раза быстрее, чем у Tacotron2.
3
Механизм самовнимания напрямую связывает входы в разные моменты времени, эффективно решая проблему моделирования дальних зависимостей.
4
Модель преобразует последовательности фонем в мел-спектрограммы, после чего вокодер WaveNet генерирует аудиоречь.
5
Предложенная система Transformer TTS заменяет рекуррентные структуры и исходный механизм внимания Tacotron2 механизмами многоголового внимания.

нейросетевая система синтеза речи (TTS) на основе Transformer, генерирующая речь из последовательностей фонем

эффективность обучения и вывода, моделирование дальних зависимостей и качество синтеза речи этой сети

Publication Details
Publication Date
2019-07-17
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Shujie Liu
Ming Liu
Naihan Li
Yanqing Liu
Sheng Zhao
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%