Робастное распознавание говорящего в условиях шума

Robust Speaker Recognition in Noisy Conditions
Ji Ming, Timothy J. Hazen, James Glass, Douglas A. Reynolds
2007-06-20

окружающий шумтеория пропущенных признаковмногоусловное обучение моделейшумовые условияраспознавание говорящего
В статье исследуется задача идентификации и верификации говорящего в условиях шума; предполагается, что речевые сигналы искажены окружающим шумом, однако сведения о характеристиках шума отсутствуют. Одним из факторов, мотивирующих данное исследование, является потенциальное применение технологий распознавания говорящего на портативных устройствах или в Интернете. Хотя эти технологии обеспечивают дополнительный биометрический уровень защиты пользователя, практическая реализация таких систем сопряжена со многими трудностями. Одной из них является окружающий шум. В связи с мобильным характером таких систем источники шума могут значительно изменяться во времени и оставаться неизвестными. Это обусловливает необходимость обеспечения устойчивости к шуму при отсутствии информации о нем. В статье описывается метод, объединяющий многорежимное обучение модели и теорию пропущенных признаков для моделирования шума с неизвестными временно-спектральными характеристиками. Многорежимное обучение выполняется с использованием смоделированных зашумленных данных с ограниченным разнообразием шумов, обеспечивая «грубую» компенсацию шума, тогда как теория пропущенных признаков применяется для уточнения компенсации за счет игнорирования вариаций шума, выходящих за пределы заданных условий обучения, что уменьшает рассогласование между обучением и тестированием. Основное внимание уделено нескольким вопросам, связанным с реализацией новой модели для приложений реального мира. К ним относятся формирование многорежимных обучающих данных для моделирования зашумленной речи, объединение различных обучающих данных для оптимизации качества распознавания и снижение сложности модели. Новый алгоритм был протестирован с использованием двух баз данных, содержащих смоделированные и реалистичные данные зашумленной речи. Первая база данных представляет собой переработанную базу TIMIT, полученную путем повторной записи данных при наличии различных типов шума; она использовалась для проверки модели идентификации говорящего с акцентом на разнообразие шумов. Вторая база данных представляет собой базу данных, собранную с использованием портативного устройства в реалистичных условиях шума...
1
Метод объединяет многорежимное обучение и теорию пропущенных признаков: смоделированные зашумлённые данные обеспечивают грубую компенсацию, а ненадёжные временно-частотные области игнорируются для уменьшения несоответствия.
2
Оценка сосредоточена на устойчивости к различным типам шума и реалистичным условиям портативных устройств, однако в представленном фрагменте аннотации количественные результаты не приведены.
3
Работа рассматривает идентификацию и верификацию говорящего при неизвестном, изменяющемся во времени шуме и возможном несоответствии условий обучения и тестирования.
4
Предложенный алгоритм оценивается на двух базах данных с симулированной и реалистичной зашумлённой речью, включая перезаписанную базу TIMIT и корпус для портативных устройств.
5
Исследуются практические вопросы реализации, включая генерацию многорежимных обучающих данных, объединение условий обучения и снижение сложности модели для применения в реальных системах.

системы идентификации и верификации говорящего, работающие с речевыми сигналами, искажёнными неизвестным изменяющимся во времени шумом окружающей среды

помехоустойчивость распознавания говорящего, включая компенсацию неизвестных временно-спектральных вариаций шума, а также их влияние на качество распознавания и сложность модели

Publication Details
Publication Date
2007-06-20
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Ji Ming
Timothy J. Hazen
James Glass
Douglas A. Reynolds
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%