Совместный подсчёт говорящих, распознавание речи и идентификация говорящих для перекрывающейся речи с произвольным числом говорящих
Joint Speaker Counting, Speech Recognition, and Speaker Identification for Overlapped Speech of any Number of Speakers
2020-10-25
SCID: 54.1/fj45rwr9
Discuss with AI
распознавание перекрывающейся речиобучение сериализованным выводомидентификация говорящихавтоматическое распознавание речи с атрибуцией говорящихошибка распознавания слов с атрибуцией говорящих
Figures from the paper
Abstract (AI)
Предлагается сквозная модель автоматического распознавания речи с атрибуцией говорящих, объединяющая подсчёт говорящих, распознавание речи и идентификацию говорящих для монофонической перекрывающейся речи. Модель основана на обучении с сериализованным выходом (serialized output training, SOT) с использованием кодировщика–декодировщика с механизмом внимания — недавно предложенного метода распознавания перекрывающейся речи с произвольным числом говорящих. Метод SOT расширен за счёт введения инвентаря говорящих в качестве вспомогательного входа, что позволяет формировать как метки говорящих, так и транскрипции речи нескольких говорящих. Все параметры модели оптимизируются с использованием критерия максимизации взаимной информации с атрибуцией говорящих, представляющего совместную вероятность распознавания перекрывающейся речи и идентификации говорящих. Эксперименты на корпусе LibriSpeech показывают, что предложенный метод обеспечивает значительно меньшую ошибку на уровне слов с атрибуцией говорящих по сравнению с базовым методом, который выполняет распознавание перекрывающейся речи и идентификацию говорящих раздельно.
Key Findings
1
Все параметры модели оптимизируются по критерию максимизации взаимной информации с атрибуцией говорящих, совместно моделирующему распознавание перекрывающейся речи и идентификацию говорящих.
2
Сквозная модель совместно выполняет подсчёт говорящих, распознавание речи и идентификацию говорящих для монофоничной перекрывающейся речи с любым числом говорящих.
3
На корпусе LibriSpeech предложенный подход значительно снижает ошибку распознавания слов с атрибуцией говорящих по сравнению с базовым методом, раздельно выполняющим распознавание и идентификацию говорящих.
4
Метод расширяет обучение сериализованных выходов, используя инвентарь говорящих как дополнительный вход для генерации меток говорящих вместе с многоговорящими транскрипциями.
Research Object
монофоническая речь с перекрытием, содержащая произвольное число говорящих
Research Subject
совместный подсчёт говорящих, распознавание многоголосой речи и идентификация говорящих с оценкой по привязанной к говорящим доле ошибок в словах
Publication Details
Publication Date
2020-10-25
Journal
Publisher
ISSN
Access Type
Author Information
Download PDF
Subscribe to digest