Робастное распознавание говорящего: подход на основе признаков

Robust speaker recognition: a feature-based approach
Richard J. Mammone, Xiaoyu Zhang, Ravi P. Ramachandran
1996-09-01

аффинное преобразованиеизвлечение признаковнесовпадающие условияробастные кепстральные признакиробастное распознавание диктора
Будущей коммерциализации технологий распознавания говорящего и речи препятствует значительное снижение производительности систем, обусловленное различиями в условиях окружающей среды между этапами обучения и тестирования. Это известно как «несогласованные условия». Исследования показали [1], что большинство современных систем обеспечивают высокую точность распознавания, если условия обучения аналогичны условиям эксплуатации (согласованные условия). Однако часто возникают несогласованные условия, при которых производительность резко снижается по сравнению с идеальными согласованными условиями. Распространённым примером такого несоответствия является обучение на чистой речи и тестирование на речи, искажённой шумом или характеристиками канала. Методы робастной обработки речи [2] направлены на сохранение производительности системы обработки речи при разнообразных условиях эксплуатации. В статье представлен обзор современных систем распознавания говорящего и проблем, возникающих при их эксплуатации; основное внимание уделено процессу извлечения признаков на переднем конце робастных методов обработки речи как способу повышения качества. Рассматривается линейный предиктивный (LP) анализ — первый этап извлечения признаков, — и описываются различные робастные кепстральные признаки, получаемые из LP-коэффициентов. Также описывается аффинное преобразование — подход к преобразованию признаков, учитывающий несоответствие условий и позволяющий одновременно компенсировать искажения, вызванные каналом и шумом.
1
В статье анализируется линейный предиктивный анализ и описываются робастные кепстральные признаки, получаемые из коэффициентов линейного предсказания.
2
Методы робастной обработки речи направлены на сохранение качества распознавания в разнообразных условиях эксплуатации, а не только при совпадающих условиях обучения и тестирования.
3
Производительность систем распознавания говорящего может резко снижаться при различии условий обучения и тестирования, особенно между чистой и зашумлённой либо искажённой каналом речью.
4
Аффинное преобразование представлено как метод преобразования признаков, учитывающий рассогласование и одновременно противодействующий искажениям канала и шуму.
5
Статья рассматривает извлечение признаков на переднем конце системы как способ повышения робастности распознавания говорящего.

системы распознавания говорящих, работающие в условиях несоответствия среды, включая речь, искажённую шумом или каналом связи

устойчивое извлечение и преобразование признаков для сохранения эффективности распознавания говорящих при несоответствии канала связи и шумовых условий

Publication Details
Publication Date
1996-09-01
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Richard J. Mammone
Xiaoyu Zhang
Ravi P. Ramachandran
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%