WavLM: крупномасштабное самосупервизорное предварительное обучение для комплексной обработки речи
WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing
2022-07-04
SCID: 54.1/sy3puq9b
Discuss with AI
бенчмарк SUPERBWavLMпредсказание маскированной речисамостоятельное предварительное обучение речиподавление речевого шума
Figures from the paper
Abstract (AI)
Самосупервизорное обучение (SSL) достигло значительных успехов в распознавании речи, однако его применение к другим задачам обработки речи изучено лишь в ограниченной степени. Поскольку речевые сигналы содержат многогранную информацию, включая идентичность говорящего, паралингвистическую информацию и содержание высказывания, обучение универсальных представлений для всех речевых задач представляет собой сложную проблему. Для ее решения мы предлагаем новую предварительно обученную модель WavLM для выполнения широкого спектра последующих задач обработки речи. На этапе предварительного обучения WavLM совместно осваивает предсказание замаскированной речи и подавление шума. Благодаря этому WavLM не только сохраняет способность моделировать содержание речи посредством предсказания замаскированной речи, но и расширяет потенциал для задач, не связанных с автоматическим распознаванием речи (ASR), за счет подавления шума в речевом сигнале. Кроме того, в архитектуре Transformer WavLM использует управляемое относительное позиционное смещение, что позволяет лучше учитывать последовательный порядок входной речи. Мы также увеличили объем обучающего набора данных с 60 тыс. часов до 94 тыс. часов. Модель WavLM Large достигает передовых результатов на бенчмарке SUPERB и обеспечивает существенное улучшение качества для различных задач обработки речи на соответствующих репрезентативных бенчмарках.
Key Findings
1
Совместное маскированное предсказание речи и шумоподавление сохраняет способность моделировать речевое содержание и улучшает представления для неречераспознающих задач, связанных с идентификацией говорящего и паралингвистикой.
2
Объем данных предварительного обучения увеличен с 60 000 до 94 000 часов речи, что поддерживает обучение представлений в большем масштабе.
3
Большая модель WavLM достигает наилучших результатов на бенчмарке SUPERB и обеспечивает значительные улучшения на репрезентативных бенчмарках различных задач обработки речи.
4
WavLM использует управляемое относительное позиционное смещение в архитектуре Transformer для более точного учета временного порядка речевых входов.
5
WavLM — это предварительно обученная модель с самоконтролируемым обучением, предназначенная для универсальных представлений в широком спектре речевых задач, включая задачи за пределами распознавания речи.
Research Object
Предобученные речевые представления WavLM для широкого спектра последующих задач обработки речи
Research Subject
Способность и эффективность представлений WavLM моделировать речевое содержание и информацию, не связанную с ASR, в различных задачах обработки речи
Publication Details
Publication Date
2022-07-04
Journal
Publisher
ISSN
Cited by
1863
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai4
Использование генеративного искусственного интеллекта для масштабирования интеллектуальных обучающих систем2023
Исследование пределов переносного обучения с унифицированным трансформером «текст-в-текст»2019
VoxCeleb: Масштабная верификация говорящих в естественных условиях2019
Исследование увеличения данных реверберационной речи для устойчивого распознавания речи2017