Диаризация и отслеживание говорящих в средах с несколькими сенсорами
Speaker diarization and tracking in multiple-sensor environments
2012-12-21
SCID: 54.1/fsve6y24
Discuss with AI
многосенсорные средысценарии интеллектуального помещениядиаризация речираспознавание говорящихотслеживание говорящих
Figures from the paper
Abstract (AI)
В диссертации рассматриваются исследования в области распознавания говорящих в реальных условиях, включая переговорные комнаты, речь телефонного качества, а также новостные передачи по радио и телевидению. Основная цель заключается в автоматическом обнаружении и классификации говорящих в сценарии интеллектуального помещения. Акустическое распознавание говорящего представляет собой применение машинных методов для идентификации человека по произнесенному высказыванию. Оно предполагает обработку акустических сигналов и преобразование их в символьные описания, соответствующие идентичности говорящих. В течение последних нескольких лет распознавание говорящих в реальных условиях привлекает значительное внимание исследователей и становится одной из технологий обработки устной речи, повышающих качество или расширяющих возможности транскрибирования записей. Реальные условия, особенно при анализе человеческой активности в переговорных комнатах или классах, характеризуются большей сложностью и создают более трудные задачи по сравнению с другими областями вследствие спонтанности речи, эффектов реверберации, наличия перекрывающейся речи, вариативности конфигурации помещения и каналов, а также широкого набора акустических событий, создаваемых людьми или объектами, которыми они пользуются. Поэтому определение как идентичности говорящих, так и их положения во времени может способствовать обнаружению и описанию человеческой активности и обеспечению контекстной осведомленности машин. Сначала мы стремимся усовершенствовать традиционные подходы к моделированию идентификации и верификации говорящих, основанные на моделях гауссовых смесей, посредством стратегий многорешенческой и многоканальной обработки в сценарии интеллектуального помещения. Особое внимание уделяется изучению методов учета вариативности говорящего и канала, таких как адаптация по максимуму апостериорной вероятности, проекция мешающих атрибутов, совместный факторный анализ и нормализация оценок, с целью выявления стратегий и методов преодоления этих ограничений. Кроме того, мы описываем новый алгоритм верификации говорящего, использующий адаптированные признаки, полученные из automati...
Key Findings
1
Изучаются методы учета вариативности говорящего и канала, включая MAP-адаптацию, проекцию мешающих атрибутов, совместный факторный анализ и нормализацию оценок.
2
Записи совещаний и занятий особенно сложны из-за спонтанной речи, реверберации, перекрывающейся речи, вариативности каналов и разнообразных акустических событий, создаваемых людьми или предметами.
3
Диссертация рассматривает автоматическую идентификацию, верификацию, диаризацию и отслеживание говорящих во времени в сложных реальных условиях, включая интеллектуальные помещения, телефонную речь и телевизионные новости.
4
В диссертации предложен алгоритм верификации говорящего, использующий адаптированные признаки, однако абстракт обрывается до полного описания метода и его результатов.
5
Для улучшения традиционных методов идентификации и верификации говорящих на основе гауссовских смесей исследуются стратегии многократного принятия решений и многоканальной обработки.
Research Object
Распознавание и диаризация говорящих в реальных акустических условиях, особенно в интеллектуальных помещениях, комнатах для совещаний, телефонной речи и радио-/телевизионных трансляциях
Research Subject
Автоматическая идентификация, верификация, классификация и временное отслеживание говорящих при вариативности каналов, реверберации, перекрывающейся речи и других акустических условиях реального мира
Publication Details
Publication Date
2012-12-21
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest