LDA с нормализацией по источнику для устойчивого распознавания дикторов с использованием i-векторов из нескольких речевых источников
Source-Normalized LDA for Robust Speaker Recognition Using i-Vectors From Multiple Speech Sources
2011-08-16
SCID: 54.1/zhn5k4m9
Discuss with AI
оценка распознавания говорящих NISTi-векторыисточник-нормализованный LDAраспознавание говорящегонормализация ковариации внутри классов
Figures from the paper
Abstract (AI)
Недавнее развитие векторной модели i-vector для распознавания дикторов установило новый стандарт качества в данной области исследований. i-вектор представляет собой компактное представление речевого высказывания диктора, извлечённое из подпространства полной вариативности. Перед классификацией с использованием косинусного ядра i-векторы проецируются в пространство линейного дискриминантного анализа (LDA) для уменьшения межсеансовой вариативности и повышения различимости дикторов. Точная оценка этого пространства LDA по обучающей выборке имеет решающее значение для качества обнаружения. Однако типичная обучающая выборка не содержит для каждого диктора высказываний, полученных из всех представляющих интерес источников. Это приводит к появлению систематической вариации, связанной с речевым источником, в ковариационной матрице междикторских различий и к неполному представлению матрицы внутридикторского рассеяния, используемой в LDA. Недавно предложенный алгоритм LDA с нормализацией по источнику (SN-LDA) повышает устойчивость распознавания дикторов на основе i-векторов как в условиях рассогласованных испытаний, так и в условиях, когда доступных речевых ресурсов недостаточно для надлежащей разработки системы. При оценке на недавних испытаниях NIST по распознаванию дикторов 2008 и 2010 годов (SRE) SN-LDA обеспечил относительное снижение частоты равных ошибок (EER) до 38% и минимальной функции стоимости обнаружения (DCF) на 44% по сравнению с LDA в условиях рассогласованных испытаний и ограниченных ресурсов, а также улучшил результаты в распространённых условиях использования только телефонной речи. В развитие этих первоначальных результатов в исследовании представлен подробный анализ того, как SN-LDA преобразует пространство i-векторов для уменьшения вариации источника, а также анализ его устойчивости при различных условиях оценки и обучения LDA. Концепция нормализации по источнику дополнительно распространена на нормализацию внутриклассовой ковариации (WCCN) и обнаружение источника на основе данных.
Key Findings
1
Обычный LDA может давать неполные оценки внутридикторского разброса и учитывать вариации источника в междикторской ковариации, если обучающие данные не охватывают все сочетания дикторов и источников.
2
На оцениваниях NIST SRE 2008 и 2010 SN-LDA обеспечил относительное улучшение до 38% по EER и до 44% по минимальному DCF по сравнению с LDA в несогласованных и малоресурсных условиях.
3
SN-LDA также улучшил результаты в стандартных условиях, использующих только телефонную речь, что подтверждает преимущества метода не только при несовпадении источников.
4
Source-нормализованный LDA уменьшает систематические вариации, связанные с источником речи, в i-векторных представлениях и повышает устойчивость распознавания дикторов.
5
Работа расширяет нормализацию источника на нормализацию внутриклассовой ковариации и обнаружение источника на основе данных, анализируя устойчивость при различных условиях оценки и обучения LDA.
Research Object
распознавание говорящих на основе i-векторов с использованием речевых высказываний из нескольких источников
Research Subject
преобразование пространства i-векторов методом LDA с нормализацией по источнику для уменьшения вариации, обусловленной источником, и повышения устойчивости при несоответствующих и ограниченных по ресурсам условиях оценки и обучения
Publication Details
Publication Date
2011-08-16
Journal
Publisher
ISSN
Access Type
Author Information
Download PDF
Subscribe to digest