Аудиовизуальная диаризация дикторов на основе пространственно-временного байесовского объединения данных

Audio-Visual Speaker Diarization Based on Spatiotemporal Bayesian Fusion
Israel D. Gebru, Silèye Ba, Xiaofei Li, Radu Horaud
2017-01-05

аудиовизуальная диаризация диктороввременная графическая модель со скрытыми переменнымиотслеживание нескольких людейпространственно-временное байесовское слияниелокализация источников речи
Диаризация дикторов заключается в отнесении речевых сигналов к участникам диалога. Предложена аудиовизуальная пространственно-временная модель диаризации. Модель хорошо подходит для сложных сценариев с несколькими участниками многостороннего взаимодействия, которые перемещаются и поворачивают головы к другим участникам, а не находятся лицом к камерам и микрофонам. Для решения задачи установления соответствия между речью и человеком отслеживание нескольких людей в видеопотоке объединяется с локализацией нескольких источников речи. Последняя задача решается с помощью нового метода аудиовизуального объединения данных, основанного на следующей процедуре: сначала из пары микрофонов извлекаются бинауральные спектральные признаки, затем контролируемый метод аудиовизуального выравнивания отображает эти признаки на изображение, и, наконец, метод полуобучаемой кластеризации соотносит бинауральные спектральные признаки с видимыми людьми. Главное преимущество этого метода по сравнению с предыдущими работами заключается в принципиально корректной обработке речевых сигналов, одновременно произносимых несколькими людьми. Сама диаризация представляется в виде временной графовой модели со скрытыми переменными, которая выводит идентичности дикторов и речевые фрагменты на основе результата процесса аудиовизуального установления соответствий, выполняемого на каждом временном срезе, а также динамики самой переменной диаризации. Предложенная формулировка обеспечивает эффективную процедуру точного вывода. Представлен новый набор данных, содержащий аудиовизуальные обучающие данные, а также ряд сценариев с несколькими участниками, ведущими формальные и неформальные диалоги. Предложенный метод тщательно протестирован и сопоставлен с несколькими современными алгоритмами диаризации.
1
Новый метод слияния отображает бинауральные спектральные признаки на изображение с помощью контролируемого аудиовизуального выравнивания, а затем полу-контролируемо кластеризует их между видимыми людьми.
2
Диаризация сформулирована как модель временного графа со скрытыми переменными и эффективным точным выводом; метод протестирован на новом аудиовизуальном наборе данных и сравнён с современными алгоритмами.
3
Для решения задачи сопоставления речи с людьми объединены отслеживание нескольких людей и локализация нескольких источников речи.
4
Метод принципиально обрабатывает одновременно произносимую речь нескольких людей, устраняя ограничение предыдущих подходов.
5
Предложена аудиовизуальная пространственно-временная модель диаризации для многосторонних взаимодействий, в которых участники перемещаются и не всегда обращены лицом к камерам и микрофонам.

аудиовизуальная диаризация говорящих в многосторонних взаимодействиях с движущимися участниками

пространственно-временное байесовское слияние для сопоставления одновременно произносимой речи с видимыми людьми и вывода идентичностей говорящих и речевых периодов

Publication Details
Publication Date
2017-01-05
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Israel D. Gebru
Silèye Ba
Xiaofei Li
Radu Horaud
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%