VoxCeleb: Масштабная верификация говорящих в естественных условиях
Voxceleb: Large-scale speaker verification in the wild
2019-10-16
SCID: 54.1/a5qj9jpg
Discuss with AI
датасет VoxCelebактивная верификация говорящегораспознавание говорящего в естественных условияхверификация говорящегодвухпоточная синхронизационная CNN
Figures from the paper
Abstract (AI)
Цель данной работы — распознавание говорящих в условиях шума и отсутствия ограничений на условия записи. Мы вносим два основных вклада. Во-первых, мы представляем аудиовизуальный набор данных очень большого масштаба, собранный из медиаматериалов с открытым доступом с использованием полностью автоматизированного конвейера. Большинство существующих наборов данных для идентификации говорящих содержат образцы, полученные в жестко ограниченных условиях, и обычно требуют ручной разметки; поэтому их размер ограничен. Мы предлагаем конвейер, основанный на методах компьютерного зрения, для создания набора данных из медиаматериалов с открытым доступом. Конвейер включает получение видеозаписей с YouTube, верификацию активного говорящего с использованием сверточной нейронной сети (CNN) с двумя потоками для синхронизации, а также подтверждение личности говорящего с помощью распознавания лиц на основе CNN. С помощью этого конвейера мы сформировали VoxCeleb, содержащий более миллиона «реальных» высказываний более чем 6 000 говорящих. Это в несколько раз больше любого общедоступного набора данных для распознавания говорящих. Во-вторых, мы разрабатываем и сравниваем различные архитектуры CNN с различными методами агрегации и функциями потерь при обучении, способными эффективно распознавать личность говорящего по голосу в различных условиях. Модели, обученные на нашем наборе данных, значительно превосходят по эффективности результаты предыдущих работ.
Key Findings
1
Исследованы архитектуры CNN, методы агрегации и функции потерь для идентификации дикторов в различных условиях.
2
Представлен VoxCeleb — автоматически сформированный аудиовизуальный набор данных, содержащий более миллиона реальных высказываний от более чем 6000 дикторов.
3
Модели, обученные на VoxCeleb, значительно превосходят предыдущие подходы по качеству распознавания дикторов.
4
Для создания набора из видео YouTube используются верификация активного говорящего с помощью двухпоточной синхронизационной CNN и распознавание лица на основе CNN.
5
VoxCeleb в несколько раз превосходит ранее доступные публичные наборы данных для распознавания дикторов по размеру и охватывает шумные, неконтролируемые условия.
Research Object
распознавание говорящих в зашумлённых и неограниченных реальных условиях
Research Subject
эффективность распознавания личности говорящего по голосу в различных условиях
Publication Details
Publication Date
2019-10-16
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai8
Анализ нормализации длины в сквозной системе верификации говорящего2018
Обобщённая сквозная функция потерь для верификации говорящего2018
X-векторы: устойчивые DNN-эмбеддинги для распознавания говорящего2018
VoxCeleb: крупномасштабный набор данных для идентификации говорящих2017
Классификация ImageNet с использованием глубоких сверточных нейронных сетей2017
Глубокое остаточное обучение для распознавания изображений2016
Сквозная текстозависимая верификация говорящего2016
Факторный анализ на переднем конце для верификации диктора2010
Работы, цитирующие эту статью4
WavLM: крупномасштабное самосупервизорное предварительное обучение для комплексной обработки речи2022
SSAST: аудиоспектрограммный трансформер с самоконтролируемым обучением2022
Почему самоконтролируемое обучение для распознавания речи способствует распознаванию говорящего?2022
Самообучение Barlow Twins для устойчивого распознавания говорящего2022