Почему самоконтролируемое обучение для распознавания речи способствует распознаванию говорящего?
Why does Self-Supervised Learning for Speech Recognition Benefit Speaker Recognition?
2022-09-16
SCID: 54.1/w57qq65s
Discuss with AI
VoxCeleb-1самоконтролируемое обучениераспознавание говорящеговерификация говорящегораспознавание речи
Figures from the paper
Abstract (AI)
В последнее время самоконтролируемое обучение (SSL) продемонстрировало высокую эффективность в распознавании говорящего, даже если целевая функция предварительного обучения разработана для распознавания речи. В этой работе мы исследуем, какие факторы обусловливают успешность самоконтролируемого обучения в задачах, связанных с распознаванием говорящего, таких как верификация говорящего (SV), посредством серии тщательно разработанных экспериментов. Результаты экспериментов на наборе данных VoxCeleb-1 показывают, что преимущество SSL для задачи SV обусловлено сочетанием функции потерь при предсказании замаскированной речи, масштаба данных и размера модели, тогда как квантователь SSL оказывает незначительное влияние. Кроме того, мы применяем метод атрибуции на основе интегрированных градиентов и визуализацию ландшафта функции потерь, чтобы понять эффективность самоконтролируемого обучения для повышения качества распознавания говорящего.
Key Findings
1
Эксперименты на VoxCeleb-1 показывают, что преимущество самообучения для верификации говорящего обусловлено совместным влиянием маскированного предсказания речи, масштаба обучающих данных и размера модели.
2
Для изучения причин улучшения распознавания говорящего при самообучении применяются атрибуция интегрированных градиентов и визуализация ландшафта функции потерь.
3
Самообучение улучшает верификацию говорящего, несмотря на использование целей предобучения, разработанных для распознавания речи.
4
Квантизатор самообучения оказывает лишь незначительное влияние на качество верификации говорящего по сравнению с маскированным предсказанием, масштабом данных и размером модели.
Research Object
самосупервизионные речевые представления и верификация говорящего на наборе данных VoxCeleb-1
Research Subject
вклад функции потерь предсказания замаскированной речи, масштаба данных, размера модели и SSL-квантизатора в эффективность верификации говорящего
Publication Details
Publication Date
2022-09-16
Journal
Publisher
ISSN
Cited by
32
Access Type
Author Information
Download PDF
Subscribe to digest