Адаптация моделей самоконтролируемого обучения для распознавания речи нескольких говорящих с использованием эмбеддингов говорящих

Adapting Self-Supervised Models to Multi-Talker Speech Recognition Using Speaker Embeddings
Zili Huang, Desh Raj, Leibny Paola Garcia, Sanjeev Khudanpur
2023-05-05

совместное моделирование говорящихраспознавание многоговорящей речисамообучениевложения говорящихизвлечение речи целевого говорящего
Методы самоконтролируемого обучения (SSL), которые обучаются представлениям данных без явного надзора, приобрели популярность в задачах обработки речи, особенно для приложений с одним говорящим. Однако в сценариях с несколькими говорящими такие модели часто демонстрируют снижение производительности, возможно, из-за несоответствия доменов, что существенно ограничивает их применение в подобных задачах. В данной работе исследуется адаптация исходных моделей SSL к задаче автоматического распознавания речи (ASR) нескольких говорящих в двух условиях. Во-первых, когда предоставляются сегментированные высказывания, показано, что добавление модуля выделения целевого говорящего (TSE), основанного на эмбеддингах регистрации, дополняет предобучение с учетом смеси. Во-вторых, для несегментированных смесей предложен новый подход совместного моделирования говорящих (JSM), агрегирующий информацию обо всех говорящих в смеси посредством их эмбеддингов. В контролируемых экспериментах на Libri2Mix показано, что использование эмбеддингов говорящих обеспечивает относительное улучшение показателя частоты ошибок в словах (WER) на 9,1% и 42,1% по сравнению с сильными базовыми методами для сегментированного и несегментированного случаев соответственно. Кроме того, эффективность предложенных моделей для реальных разговорных смесей продемонстрирована в экспериментах на наборе данных AMI. Исходный код и модели опубликованы в открытом доступе по адресу https://github.com/HuangZiliAndy/SSL_for_multitalker.
1
Для сегментированных высказываний добавление модуля извлечения речи целевого говорящего на основе эмбеддингов регистрации дополняет предобучение с учетом смеси.
2
Для неsegментированных смесей предложен метод совместного моделирования говорящих, агрегирующий информацию обо всех говорящих через их эмбеддинги.
3
На Libri2Mix использование эмбеддингов говорящих улучшает относительный WER на 9,1% для сегментированных и на 42,1% для неsegментированных смесей по сравнению с сильными базовыми методами.
4
Модели самообучения демонстрируют ухудшенное качество распознавания речи в многоговорящих сценариях, вероятно из-за несоответствия доменов.
5
Предложенные модели также эффективны на реальных разговорных смесях из набора AMI; код и модели опубликованы в открытом доступе.

предварительно обученные самоконтролируемые речевые модели, адаптированные для автоматического распознавания многодикторской речи в сегментированных высказываниях и несегментированных речевых смесях

влияние выделения целевого говорящего на основе векторных представлений говорящего и совместного моделирования говорящих на эффективность распознавания многодикторской речи

Publication Details
Publication Date
2023-05-05
Journal
Publisher
ISSN
Cited by
29
Access Type
Author Information
Authors
Zili Huang
Desh Raj
Leibny Paola Garcia
Sanjeev Khudanpur
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%