Почему самоконтролируемое обучение для распознавания речи способствует распознаванию говорящего?

Why does Self-Supervised Learning for Speech Recognition Benefit Speaker Recognition?
Yu Wu, Furu Wei, Zhuo Chen, Shujie Liu, Jinyu Li, Xiangzhan Yu, Chengyi Wang, Sanyuan Chen, Jian Wu, Gang Liu, Peidong Wang
2022-09-16

VoxCeleb-1самоконтролируемое обучениераспознавание говорящеговерификация говорящегораспознавание речи
В последнее время самоконтролируемое обучение (SSL) продемонстрировало высокую эффективность в распознавании говорящего, даже если целевая функция предварительного обучения разработана для распознавания речи. В этой работе мы исследуем, какие факторы обусловливают успешность самоконтролируемого обучения в задачах, связанных с распознаванием говорящего, таких как верификация говорящего (SV), посредством серии тщательно разработанных экспериментов. Результаты экспериментов на наборе данных VoxCeleb-1 показывают, что преимущество SSL для задачи SV обусловлено сочетанием функции потерь при предсказании замаскированной речи, масштаба данных и размера модели, тогда как квантователь SSL оказывает незначительное влияние. Кроме того, мы применяем метод атрибуции на основе интегрированных градиентов и визуализацию ландшафта функции потерь, чтобы понять эффективность самоконтролируемого обучения для повышения качества распознавания говорящего.
1
Эксперименты на VoxCeleb-1 показывают, что преимущество самообучения для верификации говорящего обусловлено совместным влиянием маскированного предсказания речи, масштаба обучающих данных и размера модели.
2
Для изучения причин улучшения распознавания говорящего при самообучении применяются атрибуция интегрированных градиентов и визуализация ландшафта функции потерь.
3
Самообучение улучшает верификацию говорящего, несмотря на использование целей предобучения, разработанных для распознавания речи.
4
Квантизатор самообучения оказывает лишь незначительное влияние на качество верификации говорящего по сравнению с маскированным предсказанием, масштабом данных и размером модели.

самосупервизионные речевые представления и верификация говорящего на наборе данных VoxCeleb-1

вклад функции потерь предсказания замаскированной речи, масштаба данных, размера модели и SSL-квантизатора в эффективность верификации говорящего

Publication Details
Publication Date
2022-09-16
Journal
Publisher
ISSN
Cited by
32
Access Type
Author Information
Authors
Yu Wu
Furu Wei
Zhuo Chen
Shujie Liu
Jinyu Li
Xiangzhan Yu
Chengyi Wang
Sanyuan Chen
Jian Wu
Gang Liu
Peidong Wang
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%