Аудиовизуальная диаризация дикторов на основе пространственно-временного байесовского объединения данных
Audio-Visual Speaker Diarization Based on Spatiotemporal Bayesian Fusion
2017-01-05
SCID: 54.1/887etktj
Discuss with AI
аудиовизуальная диаризация диктороввременная графическая модель со скрытыми переменнымиотслеживание нескольких людейпространственно-временное байесовское слияниелокализация источников речи
Figures from the paper
Abstract (AI)
Диаризация дикторов заключается в отнесении речевых сигналов к участникам диалога. Предложена аудиовизуальная пространственно-временная модель диаризации. Модель хорошо подходит для сложных сценариев с несколькими участниками многостороннего взаимодействия, которые перемещаются и поворачивают головы к другим участникам, а не находятся лицом к камерам и микрофонам. Для решения задачи установления соответствия между речью и человеком отслеживание нескольких людей в видеопотоке объединяется с локализацией нескольких источников речи. Последняя задача решается с помощью нового метода аудиовизуального объединения данных, основанного на следующей процедуре: сначала из пары микрофонов извлекаются бинауральные спектральные признаки, затем контролируемый метод аудиовизуального выравнивания отображает эти признаки на изображение, и, наконец, метод полуобучаемой кластеризации соотносит бинауральные спектральные признаки с видимыми людьми. Главное преимущество этого метода по сравнению с предыдущими работами заключается в принципиально корректной обработке речевых сигналов, одновременно произносимых несколькими людьми. Сама диаризация представляется в виде временной графовой модели со скрытыми переменными, которая выводит идентичности дикторов и речевые фрагменты на основе результата процесса аудиовизуального установления соответствий, выполняемого на каждом временном срезе, а также динамики самой переменной диаризации. Предложенная формулировка обеспечивает эффективную процедуру точного вывода. Представлен новый набор данных, содержащий аудиовизуальные обучающие данные, а также ряд сценариев с несколькими участниками, ведущими формальные и неформальные диалоги. Предложенный метод тщательно протестирован и сопоставлен с несколькими современными алгоритмами диаризации.
Key Findings
1
Новый метод слияния отображает бинауральные спектральные признаки на изображение с помощью контролируемого аудиовизуального выравнивания, а затем полу-контролируемо кластеризует их между видимыми людьми.
2
Диаризация сформулирована как модель временного графа со скрытыми переменными и эффективным точным выводом; метод протестирован на новом аудиовизуальном наборе данных и сравнён с современными алгоритмами.
3
Для решения задачи сопоставления речи с людьми объединены отслеживание нескольких людей и локализация нескольких источников речи.
4
Метод принципиально обрабатывает одновременно произносимую речь нескольких людей, устраняя ограничение предыдущих подходов.
5
Предложена аудиовизуальная пространственно-временная модель диаризации для многосторонних взаимодействий, в которых участники перемещаются и не всегда обращены лицом к камерам и микрофонам.
Research Object
аудиовизуальная диаризация говорящих в многосторонних взаимодействиях с движущимися участниками
Research Subject
пространственно-временное байесовское слияние для сопоставления одновременно произносимой речи с видимыми людьми и вывода идентичностей говорящих и речевых периодов
Publication Details
Publication Date
2017-01-05
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest