Факторизация факторов диктора и шума для робастного распознавания речи

Speaker and Noise Factorization for Robust Speech Recognition
Yongqiang Wang, Mark Gales
2012-06-08

акустическая факторизацияфоновый шумлинейная регрессия максимального правдоподобиямодельный ряд Тейлора по векторамадаптация к диктору
Системы распознавания речи должны работать в широком диапазоне условий. Поэтому они должны быть устойчивы к внешней вариативности, обусловленной различными акустическими факторами, такими как различия между дикторами, канал передачи и фоновый шум. Во многих сценариях несколько факторов одновременно влияют на лежащий в основе «чистый» речевой сигнал. В статье рассматриваются методы учета различий как между дикторами, так и в уровне фонового шума. Используется подход, основанный на акустической факторизации, в рамках которого отдельные преобразования предназначены для представления фактора диктора — линейной регрессии с максимальным правдоподобием (MLLR), — а также факторов шума и канала — модельного векторного ряда Тейлора (VTS). По сравнению со стандартными подходами, моделирующими совокупное воздействие факторов диктора и шума, этот подход отличается высокой гибкостью. Например, факторизация позволяет применять характеристики диктора, полученные в одном шумовом окружении, в другой среде. Для реализации такой факторизации выводятся модифицированные версии процедур обучения и применения MLLR и VTS. Предложенная схема оценивается как для адаптации, так и для факторизации на данных AURORA4.
1
Для факторизации говорящего и шума разработаны модифицированные процедуры обучения и применения MLLR и VTS.
2
Характеристики говорящего представляются с помощью MLLR, а эффекты шума и канала моделируются преобразованиями на основе разложения в ряд Тейлора по векторам (VTS).
3
Факторизованная схема гибче моделирования совокупного влияния говорящего и шума и позволяет переносить характеристики говорящего, полученные в одном шумовом окружении, в другое.
4
В работе акустическая вариативность факторизуется на отдельные преобразования для говорящего, шума и канала связи, повышая устойчивость распознавания речи.
5
Предложенный подход оценён на наборе данных AURORA4 в задачах адаптации и факторизации.

системы распознавания речи, работающие в условиях вариативности диктора, фонового шума и канала передачи

акустическая факторизация и устойчивость к раздельному и совместному воздействию факторов диктора, фонового шума и канала

Publication Details
Publication Date
2012-06-08
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Yongqiang Wang
Mark Gales
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%