Полная сквозная система верификации говорящего на основе глубоких нейронных сетей: от исходных сигналов до результата верификации
A Complete End-to-End Speaker Verification System Using Deep Neural Networks: From Raw Signals to Verification Result
2018-04-01
SCID: 54.1/7mgez8yy
Discuss with AI
глубокие нейронные сетисквозная верификация говорящегодолгая краткосрочная памятьнеобработанные аудиосигналысвёртка с шагом
Figures from the paper
Abstract (AI)
Сквозные системы на основе глубоких нейронных сетей широко исследуются в области верификации говорящего. Обработка исходных аудиосигналов также получила широкое распространение в задачах автоматической категоризации музыки и распознавания речи. Однако, насколько нам известно, сквозные системы, использующие исходные аудиосигналы, ранее не исследовались применительно к верификации говорящего. В данной работе предложена полная сквозная система верификации говорящего, которая принимает на вход исходные аудиосигналы и выдает результаты верификации. Основное внимание уделено слою предварительной обработки и моделям выделения признаков говорящего, интегрированным в систему. Предложенный слой предварительного усиления объединен со сверточным слоем с шагом для предварительной обработки в первых двух скрытых слоях. Кроме того, предложены модели выделения признаков говорящего на основе сверточных слоев и долговременной краткосрочной памяти (LSTM) для встраивания в предлагаемую сквозную систему.
Key Findings
1
Для предварительной обработки необработанного сигнала в первых двух скрытых слоях используется обучаемый слой предыскажения в сочетании со свёрточным слоем с прореживанием.
2
В архитектуру сквозной системы встроены модели извлечения признаков говорящего на основе свёрточных слоёв и долгой краткосрочной памяти.
3
В работе предложена полностью сквозная система верификации говорящего, напрямую преобразующая необработанные аудиосигналы в результаты верификации.
4
Работа рассматривает ранее не исследовавшееся, согласно аннотации, использование необработанных аудиосигналов в сквозной верификации говорящего.
Research Object
сквозная система верификации говорящего, обрабатывающая исходные аудиосигналы
Research Subject
архитектуры предварительной обработки и встроенного извлечения признаков говорящего, включая совместное применение предыскажения и свёртки с шагом, а также свёрточные модели и модели LSTM, для получения результатов верификации
Publication Details
Publication Date
2018-04-01
Journal
Publisher
ISSN
Access Type
Author Information
Download PDF
Subscribe to digest