Использование визуальной информации при самосупервизированном распознавании говорящих на основе аудиоданных

Incorporating Visual Information in Audio Based Self-Supervised Speaker Recognition
Danwei Cai, Weiqing Wang, Ming Li
2022-01-01

VoxCelebаудиовизуальное обучениеконтрастивное самообучениекластеризация псевдометоксамообучаемое распознавание говорящего
Современные успехи глубокого обучения во многом обусловлены доступностью больших объемов размеченных данных. Однако сбор крупномасштабных наборов данных с аннотациями, выполненными человеком, может быть дорогостоящим и иногда затруднительным. Поэтому самосупервизированное обучение привлекает значительный интерес исследователей как метод обучения моделей без разметки. В данной статье предлагается структура самосупервизированного обучения для распознавания говорящих. Сочетание кластеризации с глубоким обучением представлений позволяет предложенной структуре генерировать псевдометки для неразмеченного набора данных и обучать представления говорящих без аннотаций, выполненных человеком. Метод начинается с обучения кодировщика представлений говорящего с использованием контрастивного самосупервизированного обучения. Кластеризация полученных представлений генерирует псевдометки, которые используются в качестве обучающих сигналов на последующем этапе обучения кодировщика представлений. Процессы кластеризации и обучения представлений выполняются итеративно, что позволяет постепенно повысить дискриминативную способность глубокой нейронной сети. Предложенная структура самосупервизированного обучения применяется как к одномодальным аудиоданным, так и к мультимодальным аудиовизуальным данным. Для аудиовизуальных данных используются кодировщики аудиальных и визуальных представлений, предназначенные для обучения представлений соответствующих модальностей. Затем для объединения результатов кластеризации двух модальностей применяется алгоритм ансамблирования кластеров. Дополнительная информация, содержащаяся в мультимодальных данных, обеспечивает устойчивый и отказоустойчивый обучающий сигнал для обучения аудиальных и визуальных представлений. Экспериментальные результаты показывают, что предложенная итеративная структура самосупервизированного обучения значительно превосходит предыдущие методы самосупервизированного обучения. При обучении на одномодальных аудиоданных из набора разработки VoxCeleb2 предложенная структура достигает равной частоты ошибок (EER) 2,8% на исходных тестовых испытаниях VoxCeleb1. При добавлении визуальной модальности EER дополнительно снижается до 1,8%, что лишь на 20% выше показателя полностью контролируемой аудиосистемы с...
1
Добавление визуальной информации и объединение кластерных назначений аудио и видео снижает EER до 1,8%, демонстрируя взаимодополняемость мультимодальных данных.
2
При обучении на наборе VoxCeleb2 система только с аудио достигает равной ошибки (EER) 2,8% на исходных тестовых испытаниях VoxCeleb1.
3
Согласно аннотации, метод значительно превосходит предыдущие самоконтролируемые подходы и обеспечивает более устойчивый, отказоустойчивый сигнал обучения благодаря мультимодальному объединению.
4
Предложен итеративный метод самоконтролируемого распознавания говорящих, чередующий контрастивное обучение представлений и генерацию псевдометок кластеризацией.

Аудио- и аудиовизуальные системы распознавания говорящих, обучаемые на немаркированной речи и соответствующих визуальных данных

Эффективность итеративного самообучения представлений на основе кластеризации и объединения мультимодальной информации для распознавания говорящих

Publication Details
Publication Date
2022-01-01
Journal
Publisher
ISSN
Cited by
19
Access Type
Author Information
Authors
Danwei Cai
Weiqing Wang
Ming Li
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%