Полная сквозная система верификации говорящего на основе глубоких нейронных сетей: от исходных сигналов до результата верификации

A Complete End-to-End Speaker Verification System Using Deep Neural Networks: From Raw Signals to Verification Result
Jee- Weon Jung, Hee-Soo Heo, IL-Ho Yang, Hye-jin Shim, Ha-Jin Yu
2018-04-01

глубокие нейронные сетисквозная верификация говорящегодолгая краткосрочная памятьнеобработанные аудиосигналысвёртка с шагом
Сквозные системы на основе глубоких нейронных сетей широко исследуются в области верификации говорящего. Обработка исходных аудиосигналов также получила широкое распространение в задачах автоматической категоризации музыки и распознавания речи. Однако, насколько нам известно, сквозные системы, использующие исходные аудиосигналы, ранее не исследовались применительно к верификации говорящего. В данной работе предложена полная сквозная система верификации говорящего, которая принимает на вход исходные аудиосигналы и выдает результаты верификации. Основное внимание уделено слою предварительной обработки и моделям выделения признаков говорящего, интегрированным в систему. Предложенный слой предварительного усиления объединен со сверточным слоем с шагом для предварительной обработки в первых двух скрытых слоях. Кроме того, предложены модели выделения признаков говорящего на основе сверточных слоев и долговременной краткосрочной памяти (LSTM) для встраивания в предлагаемую сквозную систему.
1
Для предварительной обработки необработанного сигнала в первых двух скрытых слоях используется обучаемый слой предыскажения в сочетании со свёрточным слоем с прореживанием.
2
В архитектуру сквозной системы встроены модели извлечения признаков говорящего на основе свёрточных слоёв и долгой краткосрочной памяти.
3
В работе предложена полностью сквозная система верификации говорящего, напрямую преобразующая необработанные аудиосигналы в результаты верификации.
4
Работа рассматривает ранее не исследовавшееся, согласно аннотации, использование необработанных аудиосигналов в сквозной верификации говорящего.

сквозная система верификации говорящего, обрабатывающая исходные аудиосигналы

архитектуры предварительной обработки и встроенного извлечения признаков говорящего, включая совместное применение предыскажения и свёртки с шагом, а также свёрточные модели и модели LSTM, для получения результатов верификации

Publication Details
Publication Date
2018-04-01
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Jee- Weon Jung
Hee-Soo Heo
IL-Ho Yang
Hye-jin Shim
Ha-Jin Yu
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%