Аугментационное состязательное обучение для самосупервизируемого распознавания говорящего

Augmentation adversarial training for self-supervised speaker recognition
Jaesung Huh, Hee Soo Heo, Jingu Kang, Shinji Watanabe, Joon Son Chung
2020-07-23

VoxCelebаугментационное состязательное обучениеконтрастивное обучениесамообучаемое распознавание говорящихпредставления говорящих
Цель данной работы — обучение устойчивых моделей распознавания говорящего без использования меток говорящих. Современные методы построения неконтролируемых представлений говорящих основаны на контрастивном обучении, при котором эмбеддинги сегментов внутри одного высказывания стремятся сделать похожими, а эмбеддинги сегментов из разных высказываний — непохожими. Однако, поскольку сегменты внутри одного высказывания имеют общие акустические характеристики, трудно отделить информацию о говорящем от информации о канале. Для решения этой проблемы мы предлагаем стратегию аугментационного состязательного обучения, которая обучает сеть различать информацию о говорящем, сохраняя инвариантность к применяемой аугментации. Поскольку аугментация имитирует акустические характеристики, обучение сети инвариантности к аугментациям также способствует формированию общей инвариантности к информации о канале. Масштабные эксперименты на наборах данных VoxCeleb и VOiCES демонстрируют значительное превосходство над предыдущими методами самосупервизии, а результаты наших самосупервизируемых моделей существенно превосходят человеческие показатели.
1
Инвариантность к аугментациям должна способствовать отделению информации о говорящем от информации о канале, устраняя ограничение контрастивного обучения внутри высказывания.
2
Эксперименты на наборах данных VoxCeleb и VOiCES показывают значительное превосходство над предыдущими методами распознавания говорящих с самоконтролем.
3
Метод формирует признаки, различающие говорящих, одновременно обеспечивая инвариантность к применяемым аугментациям, имитирующим акустические характеристики канала.
4
Разработанные модели с самоконтролем существенно превосходят человеческие результаты в представленных оценках распознавания говорящих.
5
Работа представляет состязательное обучение с аугментациями для получения устойчивых представлений говорящих без меток говорящих.

модели распознавания говорящих с самоконтролем, обученные с использованием состязательного обучения на аугментациях для речевых высказываний

робастные признаки, дискриминирующие говорящих и инвариантные к аугментациям и канальной информации, без использования меток говорящих

Publication Details
Publication Date
2020-07-23
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Jaesung Huh
Hee Soo Heo
Jingu Kang
Shinji Watanabe
Joon Son Chung
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%