VoxCeleb: Масштабная верификация говорящих в естественных условиях

Voxceleb: Large-scale speaker verification in the wild
Joon Son Chung, Andrew Zisserman, Weidi Xie, Arsha Nagrani
2019-10-16

датасет VoxCelebактивная верификация говорящегораспознавание говорящего в естественных условияхверификация говорящегодвухпоточная синхронизационная CNN
Цель данной работы — распознавание говорящих в условиях шума и отсутствия ограничений на условия записи. Мы вносим два основных вклада. Во-первых, мы представляем аудиовизуальный набор данных очень большого масштаба, собранный из медиаматериалов с открытым доступом с использованием полностью автоматизированного конвейера. Большинство существующих наборов данных для идентификации говорящих содержат образцы, полученные в жестко ограниченных условиях, и обычно требуют ручной разметки; поэтому их размер ограничен. Мы предлагаем конвейер, основанный на методах компьютерного зрения, для создания набора данных из медиаматериалов с открытым доступом. Конвейер включает получение видеозаписей с YouTube, верификацию активного говорящего с использованием сверточной нейронной сети (CNN) с двумя потоками для синхронизации, а также подтверждение личности говорящего с помощью распознавания лиц на основе CNN. С помощью этого конвейера мы сформировали VoxCeleb, содержащий более миллиона «реальных» высказываний более чем 6 000 говорящих. Это в несколько раз больше любого общедоступного набора данных для распознавания говорящих. Во-вторых, мы разрабатываем и сравниваем различные архитектуры CNN с различными методами агрегации и функциями потерь при обучении, способными эффективно распознавать личность говорящего по голосу в различных условиях. Модели, обученные на нашем наборе данных, значительно превосходят по эффективности результаты предыдущих работ.
1
Исследованы архитектуры CNN, методы агрегации и функции потерь для идентификации дикторов в различных условиях.
2
Представлен VoxCeleb — автоматически сформированный аудиовизуальный набор данных, содержащий более миллиона реальных высказываний от более чем 6000 дикторов.
3
Модели, обученные на VoxCeleb, значительно превосходят предыдущие подходы по качеству распознавания дикторов.
4
Для создания набора из видео YouTube используются верификация активного говорящего с помощью двухпоточной синхронизационной CNN и распознавание лица на основе CNN.
5
VoxCeleb в несколько раз превосходит ранее доступные публичные наборы данных для распознавания дикторов по размеру и охватывает шумные, неконтролируемые условия.

распознавание говорящих в зашумлённых и неограниченных реальных условиях

эффективность распознавания личности говорящего по голосу в различных условиях

Publication Details
Publication Date
2019-10-16
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Joon Son Chung
Andrew Zisserman
Weidi Xie
Arsha Nagrani
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%