Распознавание речи с помощью глубоких рекуррентных нейронных сетей
Speech recognition with deep recurrent neural networks
2013-05-01
SCID: 54.1/4857xpu2
Discuss with AI
Connectionist Temporal ClassificationLong Short-term Memoryраспознавание фонем TIMITглубокие рекуррентные нейронные сетисквозное обучение
Figures from the paper
Abstract (AI)
Рекуррентные нейронные сети (RNN) представляют собой мощную модель для последовательных данных. Методы сквозного обучения, такие как Connectionist Temporal Classification, позволяют обучать RNN для задач пометок последовательностей, где выравнивание входа и выхода неизвестно. Сочетание этих методов с архитектурой RNN на основе долгой краткосрочной памяти (Long Short-term Memory, LSTM) оказалось особенно плодотворным и дало передовые результаты в распознавании курсивного почерка. Тем не менее до сих пор производительность RNN в распознавании речи была разочаровывающей, тогда как глубокие прямые (feedforward) сети показывали лучшие результаты. В этой работе исследуются глубокие рекуррентные нейронные сети, которые объединяют многоуровневые представления, показавшие свою эффективность в глубоких сетях, с гибким использованием дальнего контекста, обеспечиваемым RNN. При сквозном обучении с соответствующей регуляризацией мы обнаружили, что глубокие RNN на основе LSTM достигают ошибки на тестовом наборе 17,7% на бенчмарке распознавания фонем TIMIT, что, насколько нам известно, является лучшим зафиксированным показателем.
Key Findings
1
Глубокие рекуррентные нейронные сети (deep RNN) комбинируют многослойные уровни представлений с возможностью RNN учитывать долгосрочный контекст.
2
До этой работы производительность RNN в распознавании речи отставала от глубоких полносвязных сетей; глубокие LSTM RNN устраняют и превосходят этот разрыв.
3
Достигнутая ошибка 17.7% является, по заявлению авторов, лучшим зафиксированным результатом на TIMIT на момент работы.
4
При обучении end-to-end с подходящей регуляризацией глубокие LSTM RNN достигают 17.7% ошибки на тестовом наборе TIMIT для распознавания фонем.
Research Object
Глубокие рекуррентные нейронные сети (глубокие LSTM RNN) для моделирования последовательностей в распознавании речи
Research Subject
Производительность распознавания и преимущества представлений глубокой рекуррентной (глубокой LSTM) архитектуры для распознавания речи/фонем при энд-ту-энд обучении с соответствующей регуляризацией, оцениваемые по ошибке на тесте TIMIT
Publication Details
Publication Date
2013-05-01
Journal
Publisher
ISSN
Access Type
Author Information
Download PDF
Subscribe to digest