Задача CHiME-6: решение задачи распознавания речи нескольких дикторов в неразмеченных записях

CHiME-6 Challenge: Tackling Multispeaker Speech Recognition for Unsegmented Recordings
Shinji Watanabe, Michael Mandel, Jon Barker, Emmanuel Vincent, Ashish Arora, Xuankai Chang, Sanjeev Khudanpur, Vimal Manohar, Daniel Povey, Desh Raj, David Snyder, Aswin Shanmugam Subramanian, Jan Trmal, Bar Ben Yair, Christoph Boeddeker, Zhaoheng Ni, Yusuke Fujita, Shota Horiguchi, Naoyuki Kanda, Takuya Yoshioka, Neville Ryant
2020-05-04

соревнование CHiME-6распознавание многоговорящей речидиаризация говорящихулучшение речинесегментированные записи
После успешного проведения 1-й, 2-й, 3-й, 4-й и 5-й задач CHiME мы организуем 6-ю задачу CHiME по разделению и распознаванию речи (CHiME-6). Новая задача вновь обращается к предыдущей задаче CHiME-5 и дополнительно рассматривает проблему диаризации и распознавания разговорной речи нескольких дикторов, записанной удалёнными многомикрофонными системами в обычных домашних условиях. Речевой материал тот же, что и в предыдущих записях CHiME-5, за исключением точной синхронизации микрофонных массивов. Материал был получен в сценарии званого ужина; при этом предпринимались усилия для сбора данных, репрезентативных для естественной разговорной речи. В статье представлено базовое описание задачи CHiME-6 для распознавания речи нескольких дикторов с сегментацией (трек 1) и без сегментации (трек 2). Примечательно, что трек 2 является первой в сообществе конкурсной задачей, направленной на распознавание речи нескольких дикторов в неразмеченном сценарии и обеспеченной полным набором воспроизводимых базовых решений с открытым исходным кодом, включающих модули улучшения речи, диаризации дикторов и распознавания речи.
1
CHiME-6 посвящён диаризации и распознаванию удалённой многомикрофонной разговорной речи в повседневных домашних условиях.
2
Вызов использует записи званых ужинов, предназначенные для представления естественной многоголосой разговорной речи; в материал CHiME-5 добавлена точная синхронизация микрофонных массивов.
3
Трек 1 предоставляет базовый уровень для распознавания сегментированной многоголосой речи.
4
Трек 2 рассматривает распознавание несегментированной многоголосой речи и описывается как первая в сообществе конкурсная задача такого типа.
5
Трек 2 включает полностью воспроизводимые базовые решения с открытым исходным кодом для улучшения речи, диаризации говорящих и распознавания речи.

дальняя многомикрофонная разговорная речь в повседневной домашней обстановке, записанная в сценариях званого ужина

диаризация и распознавание многоговорящей речи, включая разделение и улучшение речи, для сегментированных и несегментированных записей

Publication Details
Publication Date
2020-05-04
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Shinji Watanabe
Michael Mandel
Jon Barker
Emmanuel Vincent
Ashish Arora
Xuankai Chang
Sanjeev Khudanpur
Vimal Manohar
Daniel Povey
Desh Raj
David Snyder
Aswin Shanmugam Subramanian
Jan Trmal
Bar Ben Yair
Christoph Boeddeker
Zhaoheng Ni
Yusuke Fujita
Shota Horiguchi
Naoyuki Kanda
Takuya Yoshioka
Neville Ryant
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%