Устойчивое распознавание диктора на основе одно- и многоканального улучшения речи
Robust Speaker Recognition Based on Single-Channel and Multi-Channel Speech Enhancement
2020-01-01
SCID: 54.1/7rzu2bnb
Discuss with AI
GFCCMVDR-формирователь лучараспознавание говорящегоулучшение речиx-векторы
Figures from the paper
Abstract (AI)
В последние годы большой интерес вызывают эмбеддинги глубоких нейронных сетей (DNN) для распознавания диктора. По сравнению с i-векторами они более устойчивы к шуму и реверберации помещения, поскольку DNN используют крупномасштабное обучение. В статье рассматривается вопрос о том, сохраняют ли методы улучшения речи свою полезность при использовании эмбеддингов DNN для распознавания диктора. Исследуются одно- и многоканальное улучшение речи для текстонезависимой верификации диктора на основе x-векторов в условиях одновременного присутствия сильного диффузного шума и реверберации. Одноканальное (монофоническое) улучшение речи основано на комплексном спектральном отображении и применяется к сигналам отдельных микрофонов. Для многоканального улучшения речи используются минимально-дисперсионный формирователь диаграммы направленности с минимальными искажениями отклика (MVDR), основанный на маскировании, и его приближение ранга 1. Предложен новый метод получения масок «время–частота» из оцененной комплексной спектрограммы. Кроме того, исследуются кепстральные коэффициенты на основе гамматонной шкалы частот (GFCC) как устойчивые признаки диктора. Систематические оценки и сравнения на ретранслированном корпусе NIST SRE 2010 показывают, что как монофоническое, так и многоканальное улучшение речи значительно превосходят результаты системы на основе x-векторов, а предложенная оценка ковариационной матрицы эффективна для MVDR-формирователя.
Key Findings
1
Комплексное спектральное отображение обеспечивает одноканальное усиление, применяемое независимо к отдельным микрофонам для повышения устойчивости распознавания говорящего.
2
Маскирование, применяемое в MVDR-формирователе луча и его ранговом приближении первого ранга, обеспечивает многоканальное усиление; предложен новый способ получения масок из оценённой комплексной спектрограммы.
3
Систематические оценки на ретранслированном корпусе NIST SRE 2010 показывают, что одноканальное и многоканальное усиление значительно превосходят необработанные системы на основе x-векторов.
4
Предложенная оценка ковариационной матрицы эффективна для MVDR-формирователя луча; также исследуются GFCC как устойчивые признаки говорящего.
5
В исследовании оценивается, улучшает ли речевое усиление верификацию говорящего на основе x-векторов при сильном диффузном шуме и реверберации.
Research Object
одноканальное и многоканальное улучшение речи для текстонезависимой верификации говорящего на основе x-векторов в условиях сильного диффузного шума и реверберации
Research Subject
робастность и эффективность верификации говорящего на основе x-векторов, включая влияние монофонического и многоканального улучшения речи, MVDR-формирования диаграммы направленности и признаков GFCC в условиях шума и реверберации
Publication Details
Publication Date
2020-01-01
Journal
Publisher
ISSN
Access Type
Author Information
Download PDF
Subscribe to digest