Сквозная верификация диктора по тексту с механизмом внимания
End-to-End attention based text-dependent speaker verification
2016-12-01
SCID: 54.1/qjee4ve6
Discuss with AI
Hey Cortanaмеханизм вниманиясквозная системасверточная нейронная сеть с дискриминацией говорящихтекстонезависимая верификация говорящего
Figures from the paper
Abstract (AI)
В данной статье представлен новый тип сквозной системы верификации диктора по тексту. Ранее использование фонетически дискриминативной/дикторски дискриминативной глубокой нейронной сети (DNN) в качестве экстрактора признаков для верификации диктора демонстрировало многообещающие результаты. Извлечённые признаки на уровне кадров (bottleneck-признаки, апостериорные признаки или d-векторы) имеют одинаковые веса и агрегируются для вычисления представления диктора на уровне высказывания (d-вектора или i-вектора). В данной работе для извлечения устойчивых к шуму признаков на уровне кадров используется свёрточная нейронная сеть (CNN), дискриминативная по отношению к диктору. Эти признаки адаптивно объединяются с помощью механизма внимания для формирования вектора диктора на уровне высказывания. Предложенная модель внимания использует информацию, дискриминативную по отношению к диктору, и фонетическую информацию для обучения весов. Вся система, включая CNN и модель внимания, совместно оптимизируется с использованием сквозного критерия. Алгоритм обучения в точности воспроизводит процесс оценки, напрямую отображая тестовое высказывание и несколько высказываний целевого диктора в единственную оценку верификации. Для обучения сети алгоритм может интеллектуально выбирать наиболее похожего самозванца для каждого целевого диктора. Эффективность предложенной сквозной системы продемонстрирована на задаче верификации диктора Windows 10 «Hey Cortana».ряд
Key Findings
1
Спикер-дискриминирующая CNN извлекает устойчивые к шуму признаки на уровне кадров для текстозависимой верификации говорящего.
2
Механизм внимания объединяет признаки кадров в вектор говорящего на уровне высказывания, используя спикер-дискриминирующую и фонетическую информацию.
3
CNN и модель внимания совместно оптимизируются в сквозном режиме, напрямую отображая высказывания регистрации и тестовое высказывание в оценку верификации.
4
Эффективность метода продемонстрирована на задаче верификации говорящего Windows 10 «Hey Cortana».
5
Обучение имитирует процедуру оценки и может выбирать наиболее похожего самозванца для каждого целевого говорящего.
Research Object
сквозная система текстозависимой верификации говорящего для задачи Windows 10 «Hey Cortana»
Research Subject
объединение с помощью механизма внимания устойчивых к шуму кадровых признаков говорящего и фонетических признаков в речевые представления уровня высказывания и оценки верификации
Publication Details
Publication Date
2016-12-01
Journal
Publisher
ISSN
Access Type
Author Information
Download PDF
Subscribe to digest