Deep Speaker: сквозная нейронная система построения эмбеддингов говорящих

Deep Speaker: an End-to-End Neural Speaker Embedding System
Chao Li, Xiaokong Ma, Bing Jiang, Xiangang Li, Xuewei Zhang, Xiao Liu, Ying Cao, Ajay Kannan, Zhenyao Zhu
2017-05-05

Deep Speakerкосинусное сходствоэмбеддинги дикторовверификация дикторатриплетная функция потерь
Представлена Deep Speaker — нейронная система построения эмбеддингов говорящих, отображающая высказывания на гиперсферу, где сходство говорящих измеряется косинусным сходством. Эмбединги, генерируемые Deep Speaker, могут использоваться для решения различных задач, включая идентификацию говорящего, верификацию говорящего и кластеризацию. Для извлечения акустических признаков исследуются архитектуры ResCNN и GRU, после чего для получения эмбедингов говорящих на уровне высказывания применяется усреднение, а обучение выполняется с использованием триплетной функции потерь, основанной на косинусном сходстве. Эксперименты на трех различных наборах данных показывают, что Deep Speaker превосходит базовую систему i-vector на основе DNN. Например, на текстонезависимом наборе данных Deep Speaker снижает равную ошибку (equal error rate) при верификации на 50% (относительно) и повышает точность идентификации на 60% (относительно). Также представлены результаты, свидетельствующие о том, что адаптация модели, обученной на мандаринском китайском языке, может повысить точность распознавания англоязычных говорящих.
1
Адаптация модели, обученной на мандаринском языке, может повысить точность распознавания говорящих на английском языке, что указывает на пользу межъязыкового переноса.
2
Deep Speaker отображает речевые высказывания в гиперсферические эмбеддинги говорящих, используя косинусное сходство для измерения сходства говорящих.
3
В экспериментах на трёх различных наборах данных Deep Speaker превосходит базовый метод i-vector на основе DNN.
4
На текстонезависимом наборе данных Deep Speaker относительно снижает равную ошибку верификации на 50% и повышает точность идентификации на 60%.
5
Система сочетает извлечение акустических признаков с помощью ResCNN или GRU, усреднение для получения представлений высказываний и обучение с triplet loss на основе косинусного сходства.

нейросетевая система эмбеддингов говорящих Deep Speaker и формируемые ею представления говорящих на основе высказываний

представление сходства говорящих и эффективность распознавания говорящих, включая идентификацию, верификацию, кластеризацию и кросс-лингвистическую адаптацию

Publication Details
Publication Date
2017-05-05
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Chao Li
Xiaokong Ma
Bing Jiang
Xiangang Li
Xuewei Zhang
Xiao Liu
Ying Cao
Ajay Kannan
Zhenyao Zhu
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%