Использование визуальной информации при самосупервизированном распознавании говорящих на основе аудиоданных
Incorporating Visual Information in Audio Based Self-Supervised Speaker Recognition
2022-01-01
SCID: 54.1/d6sb5gv4
Discuss with AI
VoxCelebаудиовизуальное обучениеконтрастивное самообучениекластеризация псевдометоксамообучаемое распознавание говорящего
Figures from the paper
Abstract (AI)
Современные успехи глубокого обучения во многом обусловлены доступностью больших объемов размеченных данных. Однако сбор крупномасштабных наборов данных с аннотациями, выполненными человеком, может быть дорогостоящим и иногда затруднительным. Поэтому самосупервизированное обучение привлекает значительный интерес исследователей как метод обучения моделей без разметки. В данной статье предлагается структура самосупервизированного обучения для распознавания говорящих. Сочетание кластеризации с глубоким обучением представлений позволяет предложенной структуре генерировать псевдометки для неразмеченного набора данных и обучать представления говорящих без аннотаций, выполненных человеком. Метод начинается с обучения кодировщика представлений говорящего с использованием контрастивного самосупервизированного обучения. Кластеризация полученных представлений генерирует псевдометки, которые используются в качестве обучающих сигналов на последующем этапе обучения кодировщика представлений. Процессы кластеризации и обучения представлений выполняются итеративно, что позволяет постепенно повысить дискриминативную способность глубокой нейронной сети. Предложенная структура самосупервизированного обучения применяется как к одномодальным аудиоданным, так и к мультимодальным аудиовизуальным данным. Для аудиовизуальных данных используются кодировщики аудиальных и визуальных представлений, предназначенные для обучения представлений соответствующих модальностей. Затем для объединения результатов кластеризации двух модальностей применяется алгоритм ансамблирования кластеров. Дополнительная информация, содержащаяся в мультимодальных данных, обеспечивает устойчивый и отказоустойчивый обучающий сигнал для обучения аудиальных и визуальных представлений. Экспериментальные результаты показывают, что предложенная итеративная структура самосупервизированного обучения значительно превосходит предыдущие методы самосупервизированного обучения. При обучении на одномодальных аудиоданных из набора разработки VoxCeleb2 предложенная структура достигает равной частоты ошибок (EER) 2,8% на исходных тестовых испытаниях VoxCeleb1. При добавлении визуальной модальности EER дополнительно снижается до 1,8%, что лишь на 20% выше показателя полностью контролируемой аудиосистемы с...
Key Findings
1
Добавление визуальной информации и объединение кластерных назначений аудио и видео снижает EER до 1,8%, демонстрируя взаимодополняемость мультимодальных данных.
2
При обучении на наборе VoxCeleb2 система только с аудио достигает равной ошибки (EER) 2,8% на исходных тестовых испытаниях VoxCeleb1.
3
Согласно аннотации, метод значительно превосходит предыдущие самоконтролируемые подходы и обеспечивает более устойчивый, отказоустойчивый сигнал обучения благодаря мультимодальному объединению.
4
Предложен итеративный метод самоконтролируемого распознавания говорящих, чередующий контрастивное обучение представлений и генерацию псевдометок кластеризацией.
Research Object
Аудио- и аудиовизуальные системы распознавания говорящих, обучаемые на немаркированной речи и соответствующих визуальных данных
Research Subject
Эффективность итеративного самообучения представлений на основе кластеризации и объединения мультимодальной информации для распознавания говорящих
Publication Details
Publication Date
2022-01-01
Journal
Publisher
ISSN
Cited by
19
Access Type
Author Information
Download PDF
Subscribe to digest