RawNet: усовершенствованная сквозная глубокая нейронная сеть, использующая исходные речевые сигналы для текстонезависимой верификации говорящего
RawNet: Advanced End-to-End Deep Neural Network Using Raw Waveforms for Text-Independent Speaker Verification
2019-09-13
SCID: 54.1/uxh2urrx
Discuss with AI
Сквозные глубокие нейронные сетиМоделирование исходных аудиосигналовВложения говорящихВерификация говорящегоVoxCeleb1
Figures from the paper
Abstract (AI)
В последнее время прямое моделирование исходных речевых сигналов с помощью глубоких нейронных сетей широко исследуется для решения различных задач в области аудио. Однако верификация говорящего с использованием исходных речевых сигналов всё ещё находится на начальном этапе и требует дальнейшего изучения. В настоящем исследовании рассматриваются сквозные глубокие нейронные сети, принимающие на вход исходные речевые сигналы, с целью совершенствования различных компонентов, включая извлечение голосовых эмбеддингов на переднем конце, архитектуру модели, схемы предварительного обучения, дополнительные целевые функции и классификацию на заднем конце. Корректировка архитектуры модели с использованием схемы предварительного обучения позволяет извлекать голосовые эмбеддинги и обеспечивает существенное повышение производительности. Дополнительные целевые функции упрощают процесс извлечения голосовых эмбеддингов, объединяя два традиционных этапа: извлечение признаков на уровне высказывания, таких как i-векторы или x-векторы, и улучшение признаков, например с помощью линейного дискриминантного анализа. Также исследуются эффективные модели классификации на заднем конце, соответствующие предлагаемым голосовым эмбеддингам. Мы предлагаем сквозную систему, включающую две глубокие нейронные сети: одну — на переднем конце для извлечения голосовых эмбеддингов на уровне высказывания, а другую — на заднем конце для классификации. Эксперименты, проведённые на наборе данных VoxCeleb1, показывают, что предлагаемая модель достигает наилучших опубликованных результатов среди систем без аугментации данных. Предлагаемая система также сопоставима с современной системой на основе x-векторов, использующей аугментацию данных.
Key Findings
1
Дополнительные целевые функции объединяют извлечение представления говорящего и улучшение признаков, заменяя традиционный двухэтапный процесс на основе i-векторов или x-векторов единым процессом.
2
Корректировка архитектуры в сочетании с предварительным обучением существенно улучшает извлечение векторных представлений говорящего из исходного сигнала.
3
На наборе VoxCeleb1 RawNet достигает наилучших результатов среди систем без аугментации данных и сопоставим с системой на основе x-векторов с аугментацией.
4
RawNet напрямую моделирует исходные звуковые волны с помощью сквозной глубокой нейронной сети для текстонезависимой верификации говорящего.
5
Предложенная система использует отдельные нейронные сети для извлечения речевого представления говорящего на уровне высказывания и последующей классификации.
Research Object
сквозные системы на основе глубоких нейронных сетей, использующие необработанные волновые формы для текстонезависимой верификации диктора
Research Subject
эффективность извлечения эмбеддингов диктора и классификации на выходном этапе, включая влияние архитектуры модели, предварительного обучения, дополнительных целевых функций и моделей классификации
Publication Details
Publication Date
2019-09-13
Journal
Publisher
ISSN
Access Type
Author Information
Download PDF
Subscribe to digest