Нейросинтез речи с использованием трансформерной сети
Neural Speech Synthesis with Transformer Network
2019-07-17
SCID: 54.1/drcfytzg
Discuss with AI
трансформерная TTSвокодер WaveNetмел-спектрограммымногоцелевая самовнимательностьсинтез речи из текста
Figures from the paper
Abstract (AI)
Несмотря на то что были предложены сквозные нейронные методы синтеза речи из текста (TTS), такие как Tacotron2, и они демонстрируют результаты, соответствующие передовому уровню, им по-прежнему присущи две проблемы: (1) низкая эффективность обучения и вывода; (2) сложность моделирования дальних зависимостей с помощью современных рекуррентных нейронных сетей (RNN). Вдохновившись успехом трансформерных сетей в нейронном машинном переводе (NMT), в данной работе мы внедряем и адаптируем механизм многоголового внимания, заменяя им рекуррентные структуры, а также исходный механизм внимания в Tacotron2. Благодаря многоголовому самомножественному вниманию скрытые состояния кодировщика и декодировщика формируются параллельно, что повышает эффективность обучения. Кроме того, любые два входных элемента, относящиеся к различным временным шагам, напрямую связываются посредством механизма самомножественного внимания, что эффективно решает проблему дальних зависимостей. Используя последовательности фонем в качестве входных данных, наша трансформерная TTS-сеть генерирует мел-спектрограммы, которые затем обрабатываются вокодером WaveNet для получения итогового аудиосигнала. Для оценки эффективности и производительности предложенной сети проведены эксперименты. С точки зрения эффективности наша трансформерная TTS-сеть ускоряет обучение примерно в 4,25 раза по сравнению с Tacotron2. С точки зрения производительности строгие оценки с участием людей показывают, что предложенная модель достигает результатов, соответствующих передовому уровню, превосходя Tacotron2 на 0,048, и очень близка к качеству человеческой речи (4,39 против 4,44 по средней оценке мнений, MOS).
Key Findings
1
Человеческие оценки показывают результаты уровня state of the art: модель превосходит Tacotron2 на 0,048 и приближается к человеческому качеству, получая MOS 4,39 против 4,44.
2
Параллельные вычисления в энкодере и декодере повышают эффективность обучения: оно примерно в 4,25 раза быстрее, чем у Tacotron2.
3
Механизм самовнимания напрямую связывает входы в разные моменты времени, эффективно решая проблему моделирования дальних зависимостей.
4
Модель преобразует последовательности фонем в мел-спектрограммы, после чего вокодер WaveNet генерирует аудиоречь.
5
Предложенная система Transformer TTS заменяет рекуррентные структуры и исходный механизм внимания Tacotron2 механизмами многоголового внимания.
Research Object
нейросетевая система синтеза речи (TTS) на основе Transformer, генерирующая речь из последовательностей фонем
Research Subject
эффективность обучения и вывода, моделирование дальних зависимостей и качество синтеза речи этой сети
Publication Details
Publication Date
2019-07-17
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest