Исследование увеличения данных реверберационной речи для устойчивого распознавания речи
A study on data augmentation of reverberant speech for robust speech recognition
2017-03-01
SCID: 54.1/2ndg777z
Discuss with AI
акустические модели на основе DNNзадачи LVCSRаугментация данныхдальнеканальное ASRобучение в многосостоянияхточечный шумреверберационная речьимпульсные характеристики комнаты (RIR)
Figures from the paper
Abstract (AI)
Устойчивость акустических моделей на основе глубоких нейронных сетей (DNN) к окружающей среде может быть существенно повышена при использовании обучающих данных с множественными условиями. Однако сбор данных дорогостоящий, поэтому часто применяется моделирование требуемых условий. В данной статье мы подробно описываем подход к увеличению данных для дальнего распознавания речи (far-field ASR). Мы изучаем влияние использования смоделированных импульсных откликов помещения (RIR), поскольку реальные RIR трудно получить, а также эффект добавления точечных источников шума. Мы обнаружили, что разрыв в производительности между применением смоделированных и реальных RIR может быть устранён при добавлении точечных шумов. Кроме того, мы показываем, что обученные акустические модели хорошо работают не только в сценарии дальнего разговора, но и обеспечивают лучшие результаты в сценарии близкого микрофона. Мы оцениваем наш подход на нескольких задачах распознавания речи с большим словарём (LVCSR), которые адекватно представляют оба сценария.
Key Findings
1
Акустические модели, обученные с предлагаемой реверберационной аугментацией, хорошо работают для распознавания на дальнем расстоянии и также улучшают результаты для близкого поля.
2
Добавление точечных шумов к аугментированным реверберационным сигналам устраняет разрыв в производительности между смоделированными и реальными RIR.
3
Мультиусловная тренировка данных улучшает экологическую устойчивость DNN-акустических моделей, а моделирование — жизнеспособная стратегия при высокой стоимости сбора реальных данных.
4
Предложенный метод аугментации оценён на нескольких задачах LVCSR, представляющих оба сценария — близкий и дальний.
5
Использование смоделированных импульсных характеристик помещения (RIR) для аугментации данных может соответствовать производительности реальных RIR, если добавлены точечные шумы.
Research Object
Реверберационная речь, используемая для обучения DNN-основанных акустических моделей для дистанционного распознавания речи (ASR)
Research Subject
Влияние увеличения объёма данных путём использования смоделированных импульсных характеристик помещения (RIR) и добавления точечных шумов на робастность и качество распознавания акустических моделей в условиях дистанционного (и близкого) распознавания речи
Publication Details
Publication Date
2017-03-01
Journal
Publisher
ISSN
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai2
Работы, цитирующие эту статью4
WavLM: крупномасштабное самосупервизорное предварительное обучение для комплексной обработки речи2022
Самостоятельно контролируемое распознавание говорящих с обучением, управляемым функцией потерь2022
Сквозная верификация дикторов с использованием взвешенной бинарной кросс-энтропии на основе бипартитного ранжирования и обучения по принципу усложнения задач2022
X-векторы: устойчивые DNN-эмбеддинги для распознавания говорящего2018