Инструментарий распознавания речи Kaldi
Kaldi Speech Recognition Toolkit
2024-01-01
SCID: 54.1/rjmc9cwq
Discuss with AI
инструментарий распознавания речи KaldiOpenFstакустическое моделированиеконечные преобразователиподпространственные гауссовские смеси
Figures from the paper
Abstract (AI)
Мы описываем архитектуру Kaldi — свободно распространяемого инструментария с открытым исходным кодом для исследований в области распознавания речи. Kaldi предоставляет систему распознавания речи на основе преобразователей с конечными состояниями (с использованием свободно доступного пакета OpenFst), а также подробную документацию и скрипты для построения полноценных систем распознавания. Kaldi написан на C++, а его основная библиотека поддерживает моделирование фонетического контекста произвольного размера, акустическое моделирование с использованием гауссовских смесей с подпространственной структурой (SGMM), а также стандартных гауссовских смесей, и все широко применяемые линейные и аффинные преобразования. Kaldi распространяется по лицензии Apache License версии 2.0, которая отличается минимальными ограничениями, что делает инструментарий пригодным для широкого круга пользователей. I.
Key Findings
1
Ядро на C++ поддерживает произвольные размеры фонетического контекста, акустические модели SGMM и стандартные GMM, а также распространённые линейные и аффинные преобразования.
2
Kaldi включает документацию и скрипты для построения полноценных систем распознавания речи, поддерживая воспроизводимую разработку систем.
3
Kaldi — это бесплатный инструментарий с открытым исходным кодом, предназначенный специально для исследований в области распознавания речи.
4
Kaldi распространяется по разрешительной лицензии Apache 2.0, что делает его пригодным для широкого использования сообществом специалистов по распознаванию речи.
5
Инструментарий реализует системы распознавания с использованием конечных преобразователей, опираясь на свободно доступную библиотеку OpenFst.
Research Object
Свободно распространяемый набор инструментов Kaldi с открытым исходным кодом для распознавания речи
Research Subject
Архитектура и возможности набора инструментов для построения полноценных систем распознавания речи, включая распознавание на основе трансдьюсеров конечных состояний и акустическое моделирование
Publication Details
Publication Date
2024-01-01
Journal
Publisher
ISSN
Cited by
4890
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest