Глубокие нейронные сети для акустического моделирования в распознавании речи: общее мнение четырёх исследовательских групп
Deep Neural Networks for Acoustic Modeling in Speech Recognition: The Shared Views of Four Research Groups
2012-10-19
SCID: 54.1/bsdmmrjb
Discuss with AI
смеси гауссовых распределенийакустическое моделированиеглубокие нейронные сетискрытые марковские моделираспознавание речи
Figures from the paper
Abstract (AI)
В большинстве современных систем распознавания речи для учета временной изменчивости речи используют скрытые марковские модели (HMM), а для оценки того, насколько хорошо каждое состояние HMM соответствует кадру или короткому окну кадров коэффициентов, представляющих акустический вход, применяют модели гауссовских смесей (GMM). Альтернативой является использование прямой (feed-forward) нейронной сети, которая принимает несколько кадров коэффициентов на вход и выдает апостериорные вероятности по состояниям HMM на выходе. Глубокие нейронные сети (DNN) с большим числом скрытых слоев, обучаемые с помощью недавно разработанных методов, показали превосходство над GMM на ряде бенчмарков по распознаванию речи, иногда с существенным отрывом. Эта статья дает обзор достигнутого прогресса и отражает общее мнение четырех исследовательских групп, которые недавно добились успеха в применении DNN для акустического моделирования в распознавании речи.
Key Findings
1
DNN с множеством скрытых слоёв, обученные новыми методами, показали лучшие результаты по сравнению с GMM на ряде эталонных задач распознавания речи.
2
Полносвязные глубокие нейронные сети (DNN) могут заменить GMM для оценки состояний HMM, принимая несколько кадров на вход и выдавая апостериорные вероятности по состояниям HMM.
3
Улучшения производительности от использования DNN для акустического моделирования в некоторых случаях могут быть значительными по сравнению с традиционными системами на основе GMM.
4
Статья объединяет общие взгляды и достижения четырёх исследовательских групп, недавно добившихся успеха с применением DNN для акустического моделирования.
Research Object
Глубокие нейронные сети, используемые для акустического моделирования в системах распознавания речи
Research Subject
Производительность и эффективность акустических моделей на основе DNN (оценка апостериорных вероятностей для состояний HMM по кадрам акустических признаков) по сравнению с GMM на эталонах распознавания речи и методы их обучения
Publication Details
Publication Date
2012-10-19
Journal
Publisher
ISSN
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai1
Работы, цитирующие эту статью6
Всеобъемлющий обзор графовых нейронных сетей2020
Глубокое обучение на графах: обзор2020
Искусственный интеллект и глубокое обучение в офтальмологии2018
Проектирование хиральных метаматериалов по требованию с использованием глубокого обучения2018
Схема глубокого обучения для классификации воображаемых двигательных действий на основе ограниченных машин Больцмана2016
Дистилляция знаний в нейронной сети2015