Онлайн-нейронная диаризация речи с отслеживанием целевых дикторов
Online Neural Speaker Diarization With Target Speaker Tracking
2024-01-01
SCID: 54.1/grkgnkvy
Discuss with AI
DIHARD IIIонлайн-диаризация говорящихэмбеддинги говорящихотслеживание целевого говорящегодетектирование голосовой активности целевого говорящего
Figures from the paper
Abstract (AI)
В статье предлагается онлайн-система детектирования речевой активности целевого диктора (TS-VAD) для задач диаризации речи, которая не использует априорные сведения от систем диаризации на основе кластеризации для получения эмбеддингов целевых дикторов. Адаптируя традиционный TS-VAD для работы в реальном времени, разработанный метод выявляет речевую активность дикторов с помощью самостоятельно сформированных эмбеддингов, обеспечивая стабильность результатов и устраняя неоднозначности перестановок на этапе вывода. На этапе вывода фронтенд-модель извлекает поуровневые эмбеддинги дикторов для каждого поступающего блока сигнала. Затем состояние детектирования каждого диктора предсказывается на основе этих поуровневых эмбеддингов и ранее оцененных эмбеддингов целевых дикторов. После этого эмбеддинги целевых дикторов обновляются путем агрегирования поуровневых эмбеддингов в соответствии с предсказаниями для текущего блока. Модель формирует результаты блок за блоком и итеративно обновляет эмбеддинги целевых дикторов до достижения конца сигнала. Экспериментальные результаты показывают, что предложенный метод превосходит офлайн-системы диаризации на основе кластеризации на наборах данных DIHARD III и AliMeeting. Кроме того, данный подход был расширен для многоканальных данных и продемонстрировал сопоставимую эффективность с современными офлайн-системами диаризации.
Key Findings
1
Онлайн-система обнаружения голосовой активности целевых говорящих выполняет диаризацию без использования эмбеддингов говорящих, полученных из предварительных систем кластеризации.
2
Расширение метода на многоканальные аудиоданные обеспечивает качество, сопоставимое с современными офлайн-системами диаризации.
3
Самостоятельно формируемые эмбеддинги целевых говорящих обеспечивают согласованное назначение говорящих и предотвращают перестановочные несоответствия при выводе.
4
Метод поддерживает работу в реальном времени, обрабатывая сигнал блоками, извлекая покадровые эмбеддинги, предсказывая активность говорящих и итеративно обновляя их целевые эмбеддинги.
5
Предложенный подход превосходит офлайн-системы диаризации на основе кластеризации на наборах данных DIHARD III и AliMeeting.
Research Object
система онлайн-детектирования голосовой активности целевого говорящего для диаризации речи
Research Subject
идентификация активности говорящих в реальном времени и итеративное отслеживание эмбеддингов целевых говорящих без инициализации на основе кластеризации, включая согласованное по перестановкам выполнение вывода
Publication Details
Publication Date
2024-01-01
Journal
Publisher
ISSN
Cited by
7
Access Type
Author Information
Download PDF
Subscribe to digest