RawNet: усовершенствованная сквозная глубокая нейронная сеть, использующая исходные речевые сигналы для текстонезависимой верификации говорящего

RawNet: Advanced End-to-End Deep Neural Network Using Raw Waveforms for Text-Independent Speaker Verification
Jee-weon Jung, Hee-Soo Heo, Ju-ho Kim, Hye-jin Shim, Ha-Jin Yu
2019-09-13

Сквозные глубокие нейронные сетиМоделирование исходных аудиосигналовВложения говорящихВерификация говорящегоVoxCeleb1
В последнее время прямое моделирование исходных речевых сигналов с помощью глубоких нейронных сетей широко исследуется для решения различных задач в области аудио. Однако верификация говорящего с использованием исходных речевых сигналов всё ещё находится на начальном этапе и требует дальнейшего изучения. В настоящем исследовании рассматриваются сквозные глубокие нейронные сети, принимающие на вход исходные речевые сигналы, с целью совершенствования различных компонентов, включая извлечение голосовых эмбеддингов на переднем конце, архитектуру модели, схемы предварительного обучения, дополнительные целевые функции и классификацию на заднем конце. Корректировка архитектуры модели с использованием схемы предварительного обучения позволяет извлекать голосовые эмбеддинги и обеспечивает существенное повышение производительности. Дополнительные целевые функции упрощают процесс извлечения голосовых эмбеддингов, объединяя два традиционных этапа: извлечение признаков на уровне высказывания, таких как i-векторы или x-векторы, и улучшение признаков, например с помощью линейного дискриминантного анализа. Также исследуются эффективные модели классификации на заднем конце, соответствующие предлагаемым голосовым эмбеддингам. Мы предлагаем сквозную систему, включающую две глубокие нейронные сети: одну — на переднем конце для извлечения голосовых эмбеддингов на уровне высказывания, а другую — на заднем конце для классификации. Эксперименты, проведённые на наборе данных VoxCeleb1, показывают, что предлагаемая модель достигает наилучших опубликованных результатов среди систем без аугментации данных. Предлагаемая система также сопоставима с современной системой на основе x-векторов, использующей аугментацию данных.
1
Дополнительные целевые функции объединяют извлечение представления говорящего и улучшение признаков, заменяя традиционный двухэтапный процесс на основе i-векторов или x-векторов единым процессом.
2
Корректировка архитектуры в сочетании с предварительным обучением существенно улучшает извлечение векторных представлений говорящего из исходного сигнала.
3
На наборе VoxCeleb1 RawNet достигает наилучших результатов среди систем без аугментации данных и сопоставим с системой на основе x-векторов с аугментацией.
4
RawNet напрямую моделирует исходные звуковые волны с помощью сквозной глубокой нейронной сети для текстонезависимой верификации говорящего.
5
Предложенная система использует отдельные нейронные сети для извлечения речевого представления говорящего на уровне высказывания и последующей классификации.

сквозные системы на основе глубоких нейронных сетей, использующие необработанные волновые формы для текстонезависимой верификации диктора

эффективность извлечения эмбеддингов диктора и классификации на выходном этапе, включая влияние архитектуры модели, предварительного обучения, дополнительных целевых функций и моделей классификации

Publication Details
Publication Date
2019-09-13
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Jee-weon Jung
Hee-Soo Heo
Ju-ho Kim
Hye-jin Shim
Ha-Jin Yu
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%