Глубокие нейронные сети для акустического моделирования в распознавании речи: общее мнение четырёх исследовательских групп

Deep Neural Networks for Acoustic Modeling in Speech Recognition: The Shared Views of Four Research Groups
Andrew Senior, George E. Dahl, Geoffrey E. Hinton, Vincent Vanhoucke, Tara N. Sainath, Dong Yu, Abdelrahman Mohamed, Li Deng, Navdeep Jaitly, Patrick Nguyen, Brian Kingsbury
2012-10-19

смеси гауссовых распределенийакустическое моделированиеглубокие нейронные сетискрытые марковские моделираспознавание речи
В большинстве современных систем распознавания речи для учета временной изменчивости речи используют скрытые марковские модели (HMM), а для оценки того, насколько хорошо каждое состояние HMM соответствует кадру или короткому окну кадров коэффициентов, представляющих акустический вход, применяют модели гауссовских смесей (GMM). Альтернативой является использование прямой (feed-forward) нейронной сети, которая принимает несколько кадров коэффициентов на вход и выдает апостериорные вероятности по состояниям HMM на выходе. Глубокие нейронные сети (DNN) с большим числом скрытых слоев, обучаемые с помощью недавно разработанных методов, показали превосходство над GMM на ряде бенчмарков по распознаванию речи, иногда с существенным отрывом. Эта статья дает обзор достигнутого прогресса и отражает общее мнение четырех исследовательских групп, которые недавно добились успеха в применении DNN для акустического моделирования в распознавании речи.
1
DNN с множеством скрытых слоёв, обученные новыми методами, показали лучшие результаты по сравнению с GMM на ряде эталонных задач распознавания речи.
2
Полносвязные глубокие нейронные сети (DNN) могут заменить GMM для оценки состояний HMM, принимая несколько кадров на вход и выдавая апостериорные вероятности по состояниям HMM.
3
Улучшения производительности от использования DNN для акустического моделирования в некоторых случаях могут быть значительными по сравнению с традиционными системами на основе GMM.
4
Статья объединяет общие взгляды и достижения четырёх исследовательских групп, недавно добившихся успеха с применением DNN для акустического моделирования.

Глубокие нейронные сети, используемые для акустического моделирования в системах распознавания речи

Производительность и эффективность акустических моделей на основе DNN (оценка апостериорных вероятностей для состояний HMM по кадрам акустических признаков) по сравнению с GMM на эталонах распознавания речи и методы их обучения

Publication Details
Publication Date
2012-10-19
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Andrew Senior
George E. Dahl
Geoffrey E. Hinton
Vincent Vanhoucke
Tara N. Sainath
Dong Yu
Abdelrahman Mohamed
Li Deng
Navdeep Jaitly
Patrick Nguyen
Brian Kingsbury
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%