Деидентификация говорящего с использованием распознавания дифонов и синтеза речи
Speaker de-identification using diphone recognition and speech synthesis
2015-05-01
SCID: 54.1/v48b689z
Discuss with AI
DROPSYраспознавание дифоновi-вектор/PLDAдеидентификация говорящегосинтез речи
Figures from the paper
Abstract (AI)
В статье рассматривается задача деидентификации говорящего (или голоса) путем представления нового подхода к сокрытию личности говорящих в их речи. Предлагаемый метод сначала распознает входную речь с помощью системы распознавания дифонов, а затем преобразует полученную фонетическую транскрипцию в речь другого говорящего с помощью системы синтеза речи. Поскольку при деидентификации используются этап распознавания дифонов (Diphone RecOgnition) и этап синтеза речи (sPeech SYnthesis), разработанный метод обозначается как DROPSY. В рамках этого подхода акустические модели модулей распознавания и синтеза полностью независимы друг от друга, что обеспечивает максимально высокий уровень деидентификации исходного говорящего. Предлагаемый подход к деидентификации на основе DROPSY является языко-зависимым, текстонезависимым и способен работать в реальном времени благодаря относительно простым используемым вычислительным методам. При разработке технологий деидентификации говорящего к методам деидентификации обычно предъявляются два требования: (i) невозможность установить личность говорящих на основе деидентифицированной речи и (ii) сохранение естественности и разборчивости обработанной речи. Поэтому в статье предлагаемый подход на основе DROPSY реализован с использованием двух различных методов синтеза речи: метода на основе скрытых марковских моделей (HMM) и метода на основе дифонов TD-PSOLA. Полученная деидентифицированная речь оценивается по разборчивости, а также в экспериментах по верификации говорящего с использованием современной системы распознавания говорящего на основе i-векторов и PLDA. Сравнение обоих модулей синтеза речи, интегрированных в предлагаемый метод, показывает, что каждый из них способен эффективно деидентифицировать исходных говорящих, одновременно обеспечивая разборчивость синтезированной речи.
Key Findings
1
Оба варианта синтеза — на основе HMM и дифонного TD-PSOLA — эффективно обезличивают говорящих, сохраняя разборчивость речи.
2
DROPSY обезличивает говорящих, распознавая речь в виде фонетической транскрипции на основе дифонов и синтезируя её голосом другого говорящего.
3
Обезличенная речь оценивалась по разборчивости и в экспериментах верификации говорящего с использованием системы i-vector/PLDA.
4
Независимые акустические модели распознавания и синтеза обеспечивают максимальное сокрытие личности исходного говорящего.
5
Метод зависит от языка, не зависит от текста и пригоден для работы в реальном времени благодаря относительно простым вычислительным процедурам.
Research Object
деидентификация говорящего во входной речи с использованием подхода DROPSY на основе распознавания дифонов и синтеза речи
Research Subject
эффективность синтеза речи на основе HMM и дифонного TD-PSOLA для сокрытия личности говорящего при сохранении разборчивости и естественности речи
Publication Details
Publication Date
2015-05-01
Journal
Publisher
ISSN
Access Type
Author Information
Download PDF
Subscribe to digest