Совместный подсчёт говорящих, распознавание речи и идентификация говорящих для перекрывающейся речи с произвольным числом говорящих

Joint Speaker Counting, Speech Recognition, and Speaker Identification for Overlapped Speech of any Number of Speakers
Naoyuki Kanda, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Zhuo Chen, Tianyan Zhou, Takuya Yoshioka
2020-10-25

распознавание перекрывающейся речиобучение сериализованным выводомидентификация говорящихавтоматическое распознавание речи с атрибуцией говорящихошибка распознавания слов с атрибуцией говорящих
Предлагается сквозная модель автоматического распознавания речи с атрибуцией говорящих, объединяющая подсчёт говорящих, распознавание речи и идентификацию говорящих для монофонической перекрывающейся речи. Модель основана на обучении с сериализованным выходом (serialized output training, SOT) с использованием кодировщика–декодировщика с механизмом внимания — недавно предложенного метода распознавания перекрывающейся речи с произвольным числом говорящих. Метод SOT расширен за счёт введения инвентаря говорящих в качестве вспомогательного входа, что позволяет формировать как метки говорящих, так и транскрипции речи нескольких говорящих. Все параметры модели оптимизируются с использованием критерия максимизации взаимной информации с атрибуцией говорящих, представляющего совместную вероятность распознавания перекрывающейся речи и идентификации говорящих. Эксперименты на корпусе LibriSpeech показывают, что предложенный метод обеспечивает значительно меньшую ошибку на уровне слов с атрибуцией говорящих по сравнению с базовым методом, который выполняет распознавание перекрывающейся речи и идентификацию говорящих раздельно.
1
Все параметры модели оптимизируются по критерию максимизации взаимной информации с атрибуцией говорящих, совместно моделирующему распознавание перекрывающейся речи и идентификацию говорящих.
2
Сквозная модель совместно выполняет подсчёт говорящих, распознавание речи и идентификацию говорящих для монофоничной перекрывающейся речи с любым числом говорящих.
3
На корпусе LibriSpeech предложенный подход значительно снижает ошибку распознавания слов с атрибуцией говорящих по сравнению с базовым методом, раздельно выполняющим распознавание и идентификацию говорящих.
4
Метод расширяет обучение сериализованных выходов, используя инвентарь говорящих как дополнительный вход для генерации меток говорящих вместе с многоговорящими транскрипциями.

монофоническая речь с перекрытием, содержащая произвольное число говорящих

совместный подсчёт говорящих, распознавание многоголосой речи и идентификация говорящих с оценкой по привязанной к говорящим доле ошибок в словах

Publication Details
Publication Date
2020-10-25
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Naoyuki Kanda
Yashesh Gaur
Xiaofei Wang
Zhong Meng
Zhuo Chen
Tianyan Zhou
Takuya Yoshioka
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%