Tacotron: к энд-ту-энд синтезу речи

Tacotron: Towards End-to-End Speech Synthesis
Yonghui Wu, Ron J. Weiss, Samy Bengio, Zhifeng Chen, Navdeep Jaitly, Rob Clark, Yannis Agiomyrgiannakis, Zongheng Yang, Rif A. Saurous, Yuxuan Wang, RJ Skerry-Ryan, Daisy Stanton, Ying Xiao, Quoc Khai Le
2017-08-16

Tacotronконцевой синтез речи (end-to-end)покадровая генерация речисредний показатель мнений (MOS)sequence-to-sequence синтез речи
Система преобразования текста в речь обычно состоит из нескольких стадий, таких как фронтенд анализа текста, акустическая модель и модуль синтеза аудио. Построение этих компонентов часто требует значительной предметной экспертизы и может включать хрупкие проектные решения. В этой работе мы представляем Tacotron — генеративную end-to-end модель текст-в-речь, которая синтезирует речь непосредственно из символов. Имея пары «текст–аудио», модель можно обучить полностью с нуля при случайной инициализации. Мы представляем несколько ключевых методов, позволяющих фреймворку sequence-to-sequence хорошо работать для этой сложной задачи. Tacotron достигает субъективной средней оценки восприятия (mean opinion score) 3.82 по пятибалльной шкале для американского английского, превосходя продукционную параметрическую систему по натуральности. Кроме того, поскольку Tacotron генерирует речь на уровне фреймов, он существенно быстрее методов авторегрессии на уровне сэмплов.
1
Авторы представляют ключевые приёмы для sequence-to-sequence, которые позволяют добиться высокого качества TTS для этой сложной задачи.
2
Поскольку Tacotron генерирует речь на уровне фреймов, он значительно быстрее, чем авторегрессионные методы на уровне сэмплов.
3
Tacotron достигает средней оценки восприятия (MOS) 3.82 по 5-балльной шкале для американского английского, превосходя промышленную параметрическую систему по естественности.
4
Tacotron — это сквозная генеративная система синтеза речи, которая синтезирует речь непосредственно из символов без отдельного фронтенда или акустических модулей.
5
Модель можно обучить с нуля с случайной инициализацией, используя пары <текст, аудио>.

Энд-ту-энд генеративная модель синтеза речи Tacotron, синтезирующая речь непосредственно из символов

Работоспособность и характеристики модели для синтеза речи: обучение с нуля на парах <текст, аудио>, применение методов sequence-to-sequence для задачи, субъективная естественность (MOS) и скорость генерации на уровне фреймов по сравнению с сэмпл-уровневыми авторегрессионными и параметрическими системами

Publication Details
Publication Date
2017-08-16
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Yonghui Wu
Ron J. Weiss
Samy Bengio
Zhifeng Chen
Navdeep Jaitly
Rob Clark
Yannis Agiomyrgiannakis
Zongheng Yang
Rif A. Saurous
Yuxuan Wang
RJ Skerry-Ryan
Daisy Stanton
Ying Xiao
Quoc Khai Le
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%