Инструментарий распознавания речи Kaldi

Kaldi Speech Recognition Toolkit
Daniel Povey
2024-01-01

инструментарий распознавания речи KaldiOpenFstакустическое моделированиеконечные преобразователиподпространственные гауссовские смеси
Мы описываем архитектуру Kaldi — свободно распространяемого инструментария с открытым исходным кодом для исследований в области распознавания речи. Kaldi предоставляет систему распознавания речи на основе преобразователей с конечными состояниями (с использованием свободно доступного пакета OpenFst), а также подробную документацию и скрипты для построения полноценных систем распознавания. Kaldi написан на C++, а его основная библиотека поддерживает моделирование фонетического контекста произвольного размера, акустическое моделирование с использованием гауссовских смесей с подпространственной структурой (SGMM), а также стандартных гауссовских смесей, и все широко применяемые линейные и аффинные преобразования. Kaldi распространяется по лицензии Apache License версии 2.0, которая отличается минимальными ограничениями, что делает инструментарий пригодным для широкого круга пользователей. I.
1
Ядро на C++ поддерживает произвольные размеры фонетического контекста, акустические модели SGMM и стандартные GMM, а также распространённые линейные и аффинные преобразования.
2
Kaldi включает документацию и скрипты для построения полноценных систем распознавания речи, поддерживая воспроизводимую разработку систем.
3
Kaldi — это бесплатный инструментарий с открытым исходным кодом, предназначенный специально для исследований в области распознавания речи.
4
Kaldi распространяется по разрешительной лицензии Apache 2.0, что делает его пригодным для широкого использования сообществом специалистов по распознаванию речи.
5
Инструментарий реализует системы распознавания с использованием конечных преобразователей, опираясь на свободно доступную библиотеку OpenFst.

Свободно распространяемый набор инструментов Kaldi с открытым исходным кодом для распознавания речи

Архитектура и возможности набора инструментов для построения полноценных систем распознавания речи, включая распознавание на основе трансдьюсеров конечных состояний и акустическое моделирование

Publication Details
Publication Date
2024-01-01
Journal
Publisher
ISSN
Cited by
4890
Access Type
Author Information
Authors
Daniel Povey
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%