Задача CHiME-6: решение задачи распознавания речи нескольких дикторов в неразмеченных записях
CHiME-6 Challenge: Tackling Multispeaker Speech Recognition for Unsegmented Recordings
2020-05-04
SCID: 54.1/j436vth7
Discuss with AI
соревнование CHiME-6распознавание многоговорящей речидиаризация говорящихулучшение речинесегментированные записи
Figures from the paper
Abstract (AI)
После успешного проведения 1-й, 2-й, 3-й, 4-й и 5-й задач CHiME мы организуем 6-ю задачу CHiME по разделению и распознаванию речи (CHiME-6). Новая задача вновь обращается к предыдущей задаче CHiME-5 и дополнительно рассматривает проблему диаризации и распознавания разговорной речи нескольких дикторов, записанной удалёнными многомикрофонными системами в обычных домашних условиях. Речевой материал тот же, что и в предыдущих записях CHiME-5, за исключением точной синхронизации микрофонных массивов. Материал был получен в сценарии званого ужина; при этом предпринимались усилия для сбора данных, репрезентативных для естественной разговорной речи. В статье представлено базовое описание задачи CHiME-6 для распознавания речи нескольких дикторов с сегментацией (трек 1) и без сегментации (трек 2). Примечательно, что трек 2 является первой в сообществе конкурсной задачей, направленной на распознавание речи нескольких дикторов в неразмеченном сценарии и обеспеченной полным набором воспроизводимых базовых решений с открытым исходным кодом, включающих модули улучшения речи, диаризации дикторов и распознавания речи.
Key Findings
1
CHiME-6 посвящён диаризации и распознаванию удалённой многомикрофонной разговорной речи в повседневных домашних условиях.
2
Вызов использует записи званых ужинов, предназначенные для представления естественной многоголосой разговорной речи; в материал CHiME-5 добавлена точная синхронизация микрофонных массивов.
3
Трек 1 предоставляет базовый уровень для распознавания сегментированной многоголосой речи.
4
Трек 2 рассматривает распознавание несегментированной многоголосой речи и описывается как первая в сообществе конкурсная задача такого типа.
5
Трек 2 включает полностью воспроизводимые базовые решения с открытым исходным кодом для улучшения речи, диаризации говорящих и распознавания речи.
Research Object
дальняя многомикрофонная разговорная речь в повседневной домашней обстановке, записанная в сценариях званого ужина
Research Subject
диаризация и распознавание многоговорящей речи, включая разделение и улучшение речи, для сегментированных и несегментированных записей
Publication Details
Publication Date
2020-05-04
Journal
Publisher
ISSN
Access Type
Author Information
Download PDF
Subscribe to digest