Устойчивая диаризация дикторов для совещаний

Robust speaker diarization for meetings
Xavier Anguera
2006-12-21

кластеризация снизу вверхзаписи совещанийобработка данных с нескольких микрофоновдиаризация дикторовдетектирование голосовой активности
В данной докторской диссертации представлены исследования в области диаризации дикторов для помещений, где проводятся совещания. Рассматриваются алгоритмы и реализация офлайн-системы сегментации и кластеризации дикторов для записей совещаний, при обработке которых обычно доступно более одного микрофона. Основная часть исследований была выполнена во время двухлетней работы в International Computer Science Institute (ICSI, Беркли, Калифорния). Диаризация дикторов широко изучалась применительно к записям радио- и телепередач. В большинстве предложенных систем используется тот или иной вид иерархической кластеризации данных по акустическим группам, при этом вначале неизвестны ни оптимальное число дикторов, ни их личности. Распространённый метод называется «кластеризацией снизу вверх» (bottom-up clustering): сначала формируется множество акустических групп данных, которые затем итеративно объединяются до получения оптимального числа групп при выполнении критерия остановки. Все эти системы основаны на анализе одного входного канала, что не позволяет напрямую применять их к совещаниям. Кроме того, многие из этих алгоритмов требуют обучения моделей или настройки параметров системы на внешних данных, что затрудняет их применение к данным, отличающимся от использованных для адаптации. Предлагаемая в диссертации реализация направлена на решение указанных проблем. В качестве отправной точки используется существующая в ICSI система диаризации дикторов, основанная на кластеризации снизу вверх. Сначала доступные каналы записи обрабатываются для получения единого аудиоканала более высокого качества, а также информации о расположении присутствующих дикторов. Затем реализуется система обнаружения речи и пауз, не требующая предварительного обучения и обрабатывающая с...
1
Реализован детектор речи и тишины, не требующий предварительного обучения, что снижает зависимость от внешней адаптации моделей и параметров.
2
Ограничения одноканальной диаризации преодолеваются объединением доступных каналов записи в аудиосигнал более высокого качества и извлечением информации о положении дикторов.
3
Аннотация обрывается до описания количественных результатов оценки и полного набора полученных результатов.
4
Предложенная система расширяет метод диаризации ICSI на основе восходящей агломеративной кластеризации для записей в комнатах совещаний.
5
В диссертации разработана устойчивaя офлайн-система диаризации дикторов для записей совещаний с использованием нескольких микрофонов.

записи совещаний в помещении с несколькими микрофонными каналами

устойчивая офлайн-диаризация дикторов, включая сегментацию и кластеризацию дикторов без предварительного обучения

Publication Details
Publication Date
2006-12-21
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Xavier Anguera
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%