Обучение речевых представлений с самоконтролем: обзор

Self-Supervised Speech Representation Learning: A Review
Hung-yi Lee, Tara N. Sainath, Christian Igel, Karen Livescu, Shinji Watanabe, Shang-Wen Li, Jakob D. Havtorn, Lasse Borgholt, Lars Maaløe, Katrin Kirchhoff, Abdelrahman Mohamed, Joakim Edin
2022-09-15

автоматическое распознавание речиконтрастивное обучениегенеративные методыпредиктивные методысамообучаемое обучение представлений речи
Хотя глубокое обучение с учителем произвело революцию в обработке речи и аудиосигналов, оно потребовало разработки специализированных моделей для отдельных задач и сценариев применения. Аналогичным образом, этот подход трудно применять к диалектам и языкам, для которых доступен лишь ограниченный объем размеченных данных. Методы обучения представлений с самоконтролем предполагают создание единой универсальной модели, способной приносить пользу в широком спектре задач и предметных областей. Такие методы успешно применяются в обработке естественного языка и компьютерном зрении, обеспечивая новый уровень производительности и одновременно сокращая количество меток, необходимых для многих последующих сценариев применения. В обучении речевых представлений также наблюдается прогресс по трем основным направлениям: генеративные, контрастивные и предиктивные методы. Другие подходы используют мультимодальные данные для предварительного обучения, объединяя текстовые или визуальные потоки данных с речью. Хотя обучение речевых представлений с самоконтролем все еще является молодой областью исследований, оно тесно связано с акустическим встраиванием слов и обучением без лексических ресурсов; оба этих направления активно исследуются уже много лет. В данном обзоре рассматриваются подходы к обучению речевых представлений с самоконтролем и их связи с другими областями исследований. Поскольку многие современные методы сосредоточены исключительно на автоматическом распознавании речи как последующей задаче, мы рассматриваем недавние работы по бенчмаркингу изученных представлений с целью расширения области их применения за пределы распознавания речи.
1
Поскольку многие методы оцениваются главным образом на задаче автоматического распознавания речи, новые исследования проверяют их применимость к более широкому спектру задач.
2
Современные подходы в основном относятся к генеративным, контрастивным и предиктивным методам; некоторые используют мультимодальное предварительное обучение на речевых, текстовых и визуальных данных.
3
Самообучаемое обучение речевых представлений направлено на создание универсальных моделей для различных речевых задач и областей.
4
Самообучаемое обучение речевых представлений связано с исследованиями акустических вложений слов и обучения без лексических ресурсов.
5
Эти методы могут снизить зависимость от размеченных данных, что особенно важно для малоресурсных языков и диалектов.

самосупервизируемые речевые представления и методы их обучения

подходы, категории, межмодальные связи и обобщение на последующие задачи самосупервизируемого обучения речевых представлений

Publication Details
Publication Date
2022-09-15
Journal
Publisher
ISSN
Cited by
370
Access Type
Author Information
Authors
Hung-yi Lee
Tara N. Sainath
Christian Igel
Karen Livescu
Shinji Watanabe
Shang-Wen Li
Jakob D. Havtorn
Lasse Borgholt
Lars Maaløe
Katrin Kirchhoff
Abdelrahman Mohamed
Joakim Edin
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%