Векторные представления говорящих на основе глубокой нейронной сети для сквозной верификации говорящего

Deep neural network-based speaker embeddings for end-to-end speaker verification
David Snyder, Pegah Ghahremani, Daniel Povey, Daniel Garcia-Romero, Yishay Carmiel, Sanjeev Khudanpur
2016-12-01

глубокие нейронные сетисквозная верификация говорящихравная ошибка вероятностейэмбеддинги говорящихтекстонезависимая верификация говорящих
В данной работе исследуется сквозная текстонезависимая система верификации говорящего. Архитектура состоит из глубокой нейронной сети, которая принимает речевой сегмент переменной длины и отображает его в векторное представление говорящего. Целевая функция разделяет пары записей одного и разных говорящих и повторно используется при верификации. Аналогичные системы недавно продемонстрировали перспективность для текстозависимой верификации, однако, насколько нам известно, их применение для текстонезависимой задачи не исследовалось. Показано, что при наличии большого числа говорящих в обучающей выборке предложенная система превосходит базовую систему на основе i-векторов по равной частоте ошибок (EER), а также при низких уровнях пропусков. По сравнению с базовой системой сквозная система снижает EER в среднем на 13% и на 29% при объединении результатов по условиям тестирования. Комбинированная система обеспечивает снижение в среднем на 32% и на 38% при объединении результатов.
1
Система сквозной текстонезависимой верификации говорящего напрямую преобразует речевые сегменты переменной длины в голосовые эмбеддинги с помощью глубокой нейронной сети.
2
По сравнению с базовой системой сквозная система снижает EER в среднем на 13% и на 29% при объединении всех условий тестирования.
3
Объединение систем дополнительно снижает EER в среднем на 32% и на 38% при объединении всех условий тестирования.
4
Целевая функция обучения явно разделяет пары сегментов одного и разных говорящих и повторно используется при верификации.
5
При большом числе говорящих в обучении предложенная система превосходит базовую i-vector-систему по равной вероятности ошибок и при низких частотах пропусков.

сквозная система текстонезависимой верификации говорящего

эффективность верификации и способность эмбеддингов различать говорящих, включая равную вероятность ошибок и показатели при низкой вероятности пропусков, по сравнению с базовой системой на основе i-vector

Publication Details
Publication Date
2016-12-01
Journal
Publisher
ISSN
Access Type
Author Information
Authors
David Snyder
Pegah Ghahremani
Daniel Povey
Daniel Garcia-Romero
Yishay Carmiel
Sanjeev Khudanpur
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%