WavLM: крупномасштабное самосупервизорное предварительное обучение для комплексной обработки речи

WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing
Furu Wei, Michael Zeng, Shujie Liu, Jinyu Li, Xiangzhan Yu, Yao Qian, Zhuo Chen, Yu Wu, Long Zhou, Chengyi Wang, Shuo Ren, Takuya Yoshioka, Sanyuan Chen, Zhengyang Chen, Naoyuki Kanda, Xiong Xiao, Jian Wu, Yanmin Qian
2022-07-04

бенчмарк SUPERBWavLMпредсказание маскированной речисамостоятельное предварительное обучение речиподавление речевого шума
Самосупервизорное обучение (SSL) достигло значительных успехов в распознавании речи, однако его применение к другим задачам обработки речи изучено лишь в ограниченной степени. Поскольку речевые сигналы содержат многогранную информацию, включая идентичность говорящего, паралингвистическую информацию и содержание высказывания, обучение универсальных представлений для всех речевых задач представляет собой сложную проблему. Для ее решения мы предлагаем новую предварительно обученную модель WavLM для выполнения широкого спектра последующих задач обработки речи. На этапе предварительного обучения WavLM совместно осваивает предсказание замаскированной речи и подавление шума. Благодаря этому WavLM не только сохраняет способность моделировать содержание речи посредством предсказания замаскированной речи, но и расширяет потенциал для задач, не связанных с автоматическим распознаванием речи (ASR), за счет подавления шума в речевом сигнале. Кроме того, в архитектуре Transformer WavLM использует управляемое относительное позиционное смещение, что позволяет лучше учитывать последовательный порядок входной речи. Мы также увеличили объем обучающего набора данных с 60 тыс. часов до 94 тыс. часов. Модель WavLM Large достигает передовых результатов на бенчмарке SUPERB и обеспечивает существенное улучшение качества для различных задач обработки речи на соответствующих репрезентативных бенчмарках.
1
Совместное маскированное предсказание речи и шумоподавление сохраняет способность моделировать речевое содержание и улучшает представления для неречераспознающих задач, связанных с идентификацией говорящего и паралингвистикой.
2
Объем данных предварительного обучения увеличен с 60 000 до 94 000 часов речи, что поддерживает обучение представлений в большем масштабе.
3
Большая модель WavLM достигает наилучших результатов на бенчмарке SUPERB и обеспечивает значительные улучшения на репрезентативных бенчмарках различных задач обработки речи.
4
WavLM использует управляемое относительное позиционное смещение в архитектуре Transformer для более точного учета временного порядка речевых входов.
5
WavLM — это предварительно обученная модель с самоконтролируемым обучением, предназначенная для универсальных представлений в широком спектре речевых задач, включая задачи за пределами распознавания речи.

Предобученные речевые представления WavLM для широкого спектра последующих задач обработки речи

Способность и эффективность представлений WavLM моделировать речевое содержание и информацию, не связанную с ASR, в различных задачах обработки речи

Publication Details
Publication Date
2022-07-04
Journal
Publisher
ISSN
Cited by
1863
Access Type
Author Information
Authors
Furu Wei
Michael Zeng
Shujie Liu
Jinyu Li
Xiangzhan Yu
Yao Qian
Zhuo Chen
Yu Wu
Long Zhou
Chengyi Wang
Shuo Ren
Takuya Yoshioka
Sanyuan Chen
Zhengyang Chen
Naoyuki Kanda
Xiong Xiao
Jian Wu
Yanmin Qian
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%