VoxCeleb: крупномасштабный набор данных для идентификации говорящих
VoxCeleb: A Large-Scale Speaker Identification Dataset
2017-08-16
SCID: 54.1/7urkj3bv
Discuss with AI
датасет VoxCelebверификация активного говорящегораспознавание лицидентификация говорящегодвухпоточная синхронизационная CNN
Figures from the paper
Abstract (AI)
Большинство существующих наборов данных для идентификации говорящих содержит образцы, полученные в условиях, существенно ограничивающих вариативность, и обычно размечается вручную, что ограничивает их размер. Цель данной работы — создать крупномасштабный независимый от текста набор данных для идентификации говорящих, собранный «в естественных условиях». В работе представлены два основных результата. Во-первых, предложен полностью автоматизированный конвейер на основе методов компьютерного зрения для создания набора данных из открытых медиаресурсов. Конвейер включает получение видеозаписей с YouTube, верификацию активного говорящего с использованием двухпоточной синхронизационной сверточной нейронной сети (CNN) и подтверждение личности говорящего с помощью распознавания лиц на основе CNN. С помощью этого конвейера сформирован VoxCeleb, содержащий сотни тысяч высказываний из «реального мира», принадлежащих более чем 1 000 знаменитостей. Во-вторых, различные современные методы идентификации говорящих применены и сопоставлены на этом наборе данных для определения базовых показателей качества. Показано, что архитектура на основе CNN обеспечивает наилучшие результаты как для идентификации, так и для верификации.
Key Findings
1
Полностью автоматизированный конвейер объединяет получение видео, проверку активного говорящего с помощью двухпоточной CNN и подтверждение личности на основе распознавания лиц CNN.
2
Архитектуры на основе CNN показали наилучшие результаты среди оценённых методов как для идентификации говорящих, так и для их верификации.
3
Набор данных собран из видеороликов YouTube в неконтролируемых условиях реального мира, устраняя ограничения масштаба и условий существующих наборов данных.
4
В работе сравнены современные методы идентификации говорящих на VoxCeleb и установлены базовые результаты для идентификации и верификации.
5
VoxCeleb представляет собой крупномасштабный текстонезависимый набор данных для идентификации говорящих, содержащий сотни тысяч реальных высказываний более чем 1 000 знаменитостей.
Research Object
Крупномасштабный текстонезависимый датасет VoxCeleb для идентификации говорящих, содержащий записи реальной речи более чем 1 000 знаменитостей, собранные из открытых медиаматериалов
Research Subject
Эффективность идентификации и верификации говорящих по речевым данным, собранным в естественных условиях, включая сравнительную результативность современных методов и архитектур на основе CNN
Publication Details
Publication Date
2017-08-16
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest