Адаптация моделей самоконтролируемого обучения для распознавания речи нескольких говорящих с использованием эмбеддингов говорящих
Adapting Self-Supervised Models to Multi-Talker Speech Recognition Using Speaker Embeddings
2023-05-05
SCID: 54.1/r4xwuykz
Discuss with AI
совместное моделирование говорящихраспознавание многоговорящей речисамообучениевложения говорящихизвлечение речи целевого говорящего
Figures from the paper
Abstract (AI)
Методы самоконтролируемого обучения (SSL), которые обучаются представлениям данных без явного надзора, приобрели популярность в задачах обработки речи, особенно для приложений с одним говорящим. Однако в сценариях с несколькими говорящими такие модели часто демонстрируют снижение производительности, возможно, из-за несоответствия доменов, что существенно ограничивает их применение в подобных задачах. В данной работе исследуется адаптация исходных моделей SSL к задаче автоматического распознавания речи (ASR) нескольких говорящих в двух условиях. Во-первых, когда предоставляются сегментированные высказывания, показано, что добавление модуля выделения целевого говорящего (TSE), основанного на эмбеддингах регистрации, дополняет предобучение с учетом смеси. Во-вторых, для несегментированных смесей предложен новый подход совместного моделирования говорящих (JSM), агрегирующий информацию обо всех говорящих в смеси посредством их эмбеддингов. В контролируемых экспериментах на Libri2Mix показано, что использование эмбеддингов говорящих обеспечивает относительное улучшение показателя частоты ошибок в словах (WER) на 9,1% и 42,1% по сравнению с сильными базовыми методами для сегментированного и несегментированного случаев соответственно. Кроме того, эффективность предложенных моделей для реальных разговорных смесей продемонстрирована в экспериментах на наборе данных AMI. Исходный код и модели опубликованы в открытом доступе по адресу https://github.com/HuangZiliAndy/SSL_for_multitalker.
Key Findings
1
Для сегментированных высказываний добавление модуля извлечения речи целевого говорящего на основе эмбеддингов регистрации дополняет предобучение с учетом смеси.
2
Для неsegментированных смесей предложен метод совместного моделирования говорящих, агрегирующий информацию обо всех говорящих через их эмбеддинги.
3
На Libri2Mix использование эмбеддингов говорящих улучшает относительный WER на 9,1% для сегментированных и на 42,1% для неsegментированных смесей по сравнению с сильными базовыми методами.
4
Модели самообучения демонстрируют ухудшенное качество распознавания речи в многоговорящих сценариях, вероятно из-за несоответствия доменов.
5
Предложенные модели также эффективны на реальных разговорных смесях из набора AMI; код и модели опубликованы в открытом доступе.
Research Object
предварительно обученные самоконтролируемые речевые модели, адаптированные для автоматического распознавания многодикторской речи в сегментированных высказываниях и несегментированных речевых смесях
Research Subject
влияние выделения целевого говорящего на основе векторных представлений говорящего и совместного моделирования говорящих на эффективность распознавания многодикторской речи
Publication Details
Publication Date
2023-05-05
Journal
Publisher
ISSN
Cited by
29
Access Type
Author Information
Download PDF
Subscribe to digest