Сквозная верификация диктора по тексту с механизмом внимания

End-to-End attention based text-dependent speaker verification
Shi-Xiong Zhang, Zhuo Chen, Yong Zhao, Jinyu Li, Yifan Gong
2016-12-01

Hey Cortanaмеханизм вниманиясквозная системасверточная нейронная сеть с дискриминацией говорящихтекстонезависимая верификация говорящего
В данной статье представлен новый тип сквозной системы верификации диктора по тексту. Ранее использование фонетически дискриминативной/дикторски дискриминативной глубокой нейронной сети (DNN) в качестве экстрактора признаков для верификации диктора демонстрировало многообещающие результаты. Извлечённые признаки на уровне кадров (bottleneck-признаки, апостериорные признаки или d-векторы) имеют одинаковые веса и агрегируются для вычисления представления диктора на уровне высказывания (d-вектора или i-вектора). В данной работе для извлечения устойчивых к шуму признаков на уровне кадров используется свёрточная нейронная сеть (CNN), дискриминативная по отношению к диктору. Эти признаки адаптивно объединяются с помощью механизма внимания для формирования вектора диктора на уровне высказывания. Предложенная модель внимания использует информацию, дискриминативную по отношению к диктору, и фонетическую информацию для обучения весов. Вся система, включая CNN и модель внимания, совместно оптимизируется с использованием сквозного критерия. Алгоритм обучения в точности воспроизводит процесс оценки, напрямую отображая тестовое высказывание и несколько высказываний целевого диктора в единственную оценку верификации. Для обучения сети алгоритм может интеллектуально выбирать наиболее похожего самозванца для каждого целевого диктора. Эффективность предложенной сквозной системы продемонстрирована на задаче верификации диктора Windows 10 «Hey Cortana».ряд
1
Спикер-дискриминирующая CNN извлекает устойчивые к шуму признаки на уровне кадров для текстозависимой верификации говорящего.
2
Механизм внимания объединяет признаки кадров в вектор говорящего на уровне высказывания, используя спикер-дискриминирующую и фонетическую информацию.
3
CNN и модель внимания совместно оптимизируются в сквозном режиме, напрямую отображая высказывания регистрации и тестовое высказывание в оценку верификации.
4
Эффективность метода продемонстрирована на задаче верификации говорящего Windows 10 «Hey Cortana».
5
Обучение имитирует процедуру оценки и может выбирать наиболее похожего самозванца для каждого целевого говорящего.

сквозная система текстозависимой верификации говорящего для задачи Windows 10 «Hey Cortana»

объединение с помощью механизма внимания устойчивых к шуму кадровых признаков говорящего и фонетических признаков в речевые представления уровня высказывания и оценки верификации

Publication Details
Publication Date
2016-12-01
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Shi-Xiong Zhang
Zhuo Chen
Yong Zhao
Jinyu Li
Yifan Gong
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%