Устойчивая диаризация дикторов для совещаний
Robust speaker diarization for meetings
2006-12-21
SCID: 54.1/a9mhj4qf
Discuss with AI
кластеризация снизу вверхзаписи совещанийобработка данных с нескольких микрофоновдиаризация дикторовдетектирование голосовой активности
Figures from the paper
Abstract (AI)
В данной докторской диссертации представлены исследования в области диаризации дикторов для помещений, где проводятся совещания. Рассматриваются алгоритмы и реализация офлайн-системы сегментации и кластеризации дикторов для записей совещаний, при обработке которых обычно доступно более одного микрофона. Основная часть исследований была выполнена во время двухлетней работы в International Computer Science Institute (ICSI, Беркли, Калифорния). Диаризация дикторов широко изучалась применительно к записям радио- и телепередач. В большинстве предложенных систем используется тот или иной вид иерархической кластеризации данных по акустическим группам, при этом вначале неизвестны ни оптимальное число дикторов, ни их личности. Распространённый метод называется «кластеризацией снизу вверх» (bottom-up clustering): сначала формируется множество акустических групп данных, которые затем итеративно объединяются до получения оптимального числа групп при выполнении критерия остановки. Все эти системы основаны на анализе одного входного канала, что не позволяет напрямую применять их к совещаниям. Кроме того, многие из этих алгоритмов требуют обучения моделей или настройки параметров системы на внешних данных, что затрудняет их применение к данным, отличающимся от использованных для адаптации. Предлагаемая в диссертации реализация направлена на решение указанных проблем. В качестве отправной точки используется существующая в ICSI система диаризации дикторов, основанная на кластеризации снизу вверх. Сначала доступные каналы записи обрабатываются для получения единого аудиоканала более высокого качества, а также информации о расположении присутствующих дикторов. Затем реализуется система обнаружения речи и пауз, не требующая предварительного обучения и обрабатывающая с...
Key Findings
1
Реализован детектор речи и тишины, не требующий предварительного обучения, что снижает зависимость от внешней адаптации моделей и параметров.
2
Ограничения одноканальной диаризации преодолеваются объединением доступных каналов записи в аудиосигнал более высокого качества и извлечением информации о положении дикторов.
3
Аннотация обрывается до описания количественных результатов оценки и полного набора полученных результатов.
4
Предложенная система расширяет метод диаризации ICSI на основе восходящей агломеративной кластеризации для записей в комнатах совещаний.
5
В диссертации разработана устойчивaя офлайн-система диаризации дикторов для записей совещаний с использованием нескольких микрофонов.
Research Object
записи совещаний в помещении с несколькими микрофонными каналами
Research Subject
устойчивая офлайн-диаризация дикторов, включая сегментацию и кластеризацию дикторов без предварительного обучения
Publication Details
Publication Date
2006-12-21
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest