Аугментационное состязательное обучение для самосупервизируемого распознавания говорящего
Augmentation adversarial training for self-supervised speaker recognition
2020-07-23
SCID: 54.1/cckzjb9n
Discuss with AI
VoxCelebаугментационное состязательное обучениеконтрастивное обучениесамообучаемое распознавание говорящихпредставления говорящих
Figures from the paper
Abstract (AI)
Цель данной работы — обучение устойчивых моделей распознавания говорящего без использования меток говорящих. Современные методы построения неконтролируемых представлений говорящих основаны на контрастивном обучении, при котором эмбеддинги сегментов внутри одного высказывания стремятся сделать похожими, а эмбеддинги сегментов из разных высказываний — непохожими. Однако, поскольку сегменты внутри одного высказывания имеют общие акустические характеристики, трудно отделить информацию о говорящем от информации о канале. Для решения этой проблемы мы предлагаем стратегию аугментационного состязательного обучения, которая обучает сеть различать информацию о говорящем, сохраняя инвариантность к применяемой аугментации. Поскольку аугментация имитирует акустические характеристики, обучение сети инвариантности к аугментациям также способствует формированию общей инвариантности к информации о канале. Масштабные эксперименты на наборах данных VoxCeleb и VOiCES демонстрируют значительное превосходство над предыдущими методами самосупервизии, а результаты наших самосупервизируемых моделей существенно превосходят человеческие показатели.
Key Findings
1
Инвариантность к аугментациям должна способствовать отделению информации о говорящем от информации о канале, устраняя ограничение контрастивного обучения внутри высказывания.
2
Эксперименты на наборах данных VoxCeleb и VOiCES показывают значительное превосходство над предыдущими методами распознавания говорящих с самоконтролем.
3
Метод формирует признаки, различающие говорящих, одновременно обеспечивая инвариантность к применяемым аугментациям, имитирующим акустические характеристики канала.
4
Разработанные модели с самоконтролем существенно превосходят человеческие результаты в представленных оценках распознавания говорящих.
5
Работа представляет состязательное обучение с аугментациями для получения устойчивых представлений говорящих без меток говорящих.
Research Object
модели распознавания говорящих с самоконтролем, обученные с использованием состязательного обучения на аугментациях для речевых высказываний
Research Subject
робастные признаки, дискриминирующие говорящих и инвариантные к аугментациям и канальной информации, без использования меток говорящих
Publication Details
Publication Date
2020-07-23
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest