VoxCeleb: крупномасштабный набор данных для идентификации говорящих

VoxCeleb: A Large-Scale Speaker Identification Dataset
Joon Son Chung, Andrew Zisserman, Arsha Nagrani
2017-08-16

датасет VoxCelebверификация активного говорящегораспознавание лицидентификация говорящегодвухпоточная синхронизационная CNN
Большинство существующих наборов данных для идентификации говорящих содержит образцы, полученные в условиях, существенно ограничивающих вариативность, и обычно размечается вручную, что ограничивает их размер. Цель данной работы — создать крупномасштабный независимый от текста набор данных для идентификации говорящих, собранный «в естественных условиях». В работе представлены два основных результата. Во-первых, предложен полностью автоматизированный конвейер на основе методов компьютерного зрения для создания набора данных из открытых медиаресурсов. Конвейер включает получение видеозаписей с YouTube, верификацию активного говорящего с использованием двухпоточной синхронизационной сверточной нейронной сети (CNN) и подтверждение личности говорящего с помощью распознавания лиц на основе CNN. С помощью этого конвейера сформирован VoxCeleb, содержащий сотни тысяч высказываний из «реального мира», принадлежащих более чем 1 000 знаменитостей. Во-вторых, различные современные методы идентификации говорящих применены и сопоставлены на этом наборе данных для определения базовых показателей качества. Показано, что архитектура на основе CNN обеспечивает наилучшие результаты как для идентификации, так и для верификации.
1
Полностью автоматизированный конвейер объединяет получение видео, проверку активного говорящего с помощью двухпоточной CNN и подтверждение личности на основе распознавания лиц CNN.
2
Архитектуры на основе CNN показали наилучшие результаты среди оценённых методов как для идентификации говорящих, так и для их верификации.
3
Набор данных собран из видеороликов YouTube в неконтролируемых условиях реального мира, устраняя ограничения масштаба и условий существующих наборов данных.
4
В работе сравнены современные методы идентификации говорящих на VoxCeleb и установлены базовые результаты для идентификации и верификации.
5
VoxCeleb представляет собой крупномасштабный текстонезависимый набор данных для идентификации говорящих, содержащий сотни тысяч реальных высказываний более чем 1 000 знаменитостей.

Крупномасштабный текстонезависимый датасет VoxCeleb для идентификации говорящих, содержащий записи реальной речи более чем 1 000 знаменитостей, собранные из открытых медиаматериалов

Эффективность идентификации и верификации говорящих по речевым данным, собранным в естественных условиях, включая сравнительную результативность современных методов и архитектур на основе CNN

Publication Details
Publication Date
2017-08-16
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Joon Son Chung
Andrew Zisserman
Arsha Nagrani
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%