Deep Speaker: сквозная нейронная система построения эмбеддингов говорящих
Deep Speaker: an End-to-End Neural Speaker Embedding System
2017-05-05
SCID: 54.1/9ecbb3hg
Discuss with AI
Deep Speakerкосинусное сходствоэмбеддинги дикторовверификация дикторатриплетная функция потерь
Figures from the paper
Abstract (AI)
Представлена Deep Speaker — нейронная система построения эмбеддингов говорящих, отображающая высказывания на гиперсферу, где сходство говорящих измеряется косинусным сходством. Эмбединги, генерируемые Deep Speaker, могут использоваться для решения различных задач, включая идентификацию говорящего, верификацию говорящего и кластеризацию. Для извлечения акустических признаков исследуются архитектуры ResCNN и GRU, после чего для получения эмбедингов говорящих на уровне высказывания применяется усреднение, а обучение выполняется с использованием триплетной функции потерь, основанной на косинусном сходстве. Эксперименты на трех различных наборах данных показывают, что Deep Speaker превосходит базовую систему i-vector на основе DNN. Например, на текстонезависимом наборе данных Deep Speaker снижает равную ошибку (equal error rate) при верификации на 50% (относительно) и повышает точность идентификации на 60% (относительно). Также представлены результаты, свидетельствующие о том, что адаптация модели, обученной на мандаринском китайском языке, может повысить точность распознавания англоязычных говорящих.
Key Findings
1
Адаптация модели, обученной на мандаринском языке, может повысить точность распознавания говорящих на английском языке, что указывает на пользу межъязыкового переноса.
2
Deep Speaker отображает речевые высказывания в гиперсферические эмбеддинги говорящих, используя косинусное сходство для измерения сходства говорящих.
3
В экспериментах на трёх различных наборах данных Deep Speaker превосходит базовый метод i-vector на основе DNN.
4
На текстонезависимом наборе данных Deep Speaker относительно снижает равную ошибку верификации на 50% и повышает точность идентификации на 60%.
5
Система сочетает извлечение акустических признаков с помощью ResCNN или GRU, усреднение для получения представлений высказываний и обучение с triplet loss на основе косинусного сходства.
Research Object
нейросетевая система эмбеддингов говорящих Deep Speaker и формируемые ею представления говорящих на основе высказываний
Research Subject
представление сходства говорящих и эффективность распознавания говорящих, включая идентификацию, верификацию, кластеризацию и кросс-лингвистическую адаптацию
Publication Details
Publication Date
2017-05-05
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest