Исследование увеличения данных реверберационной речи для устойчивого распознавания речи

A study on data augmentation of reverberant speech for robust speech recognition
Daniel Povey, Sanjeev Khudanpur, Tom Ko, Vijayaditya Peddinti, Michael L. Seltzer
2017-03-01

акустические модели на основе DNNзадачи LVCSRаугментация данныхдальнеканальное ASRобучение в многосостоянияхточечный шумреверберационная речьимпульсные характеристики комнаты (RIR)
Устойчивость акустических моделей на основе глубоких нейронных сетей (DNN) к окружающей среде может быть существенно повышена при использовании обучающих данных с множественными условиями. Однако сбор данных дорогостоящий, поэтому часто применяется моделирование требуемых условий. В данной статье мы подробно описываем подход к увеличению данных для дальнего распознавания речи (far-field ASR). Мы изучаем влияние использования смоделированных импульсных откликов помещения (RIR), поскольку реальные RIR трудно получить, а также эффект добавления точечных источников шума. Мы обнаружили, что разрыв в производительности между применением смоделированных и реальных RIR может быть устранён при добавлении точечных шумов. Кроме того, мы показываем, что обученные акустические модели хорошо работают не только в сценарии дальнего разговора, но и обеспечивают лучшие результаты в сценарии близкого микрофона. Мы оцениваем наш подход на нескольких задачах распознавания речи с большим словарём (LVCSR), которые адекватно представляют оба сценария.
1
Акустические модели, обученные с предлагаемой реверберационной аугментацией, хорошо работают для распознавания на дальнем расстоянии и также улучшают результаты для близкого поля.
2
Добавление точечных шумов к аугментированным реверберационным сигналам устраняет разрыв в производительности между смоделированными и реальными RIR.
3
Мультиусловная тренировка данных улучшает экологическую устойчивость DNN-акустических моделей, а моделирование — жизнеспособная стратегия при высокой стоимости сбора реальных данных.
4
Предложенный метод аугментации оценён на нескольких задачах LVCSR, представляющих оба сценария — близкий и дальний.
5
Использование смоделированных импульсных характеристик помещения (RIR) для аугментации данных может соответствовать производительности реальных RIR, если добавлены точечные шумы.

Реверберационная речь, используемая для обучения DNN-основанных акустических моделей для дистанционного распознавания речи (ASR)

Влияние увеличения объёма данных путём использования смоделированных импульсных характеристик помещения (RIR) и добавления точечных шумов на робастность и качество распознавания акустических моделей в условиях дистанционного (и близкого) распознавания речи

Publication Details
Publication Date
2017-03-01
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Daniel Povey
Sanjeev Khudanpur
Tom Ko
Vijayaditya Peddinti
Michael L. Seltzer
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%