Деидентификация говорящего с использованием распознавания дифонов и синтеза речи

Speaker de-identification using diphone recognition and speech synthesis
Tadej Justin, Vitomir Štruc, Simon Dobrišek, Boštjan Vesnicer, Ivo Ipšić, France Mihelič
2015-05-01

DROPSYраспознавание дифоновi-вектор/PLDAдеидентификация говорящегосинтез речи
В статье рассматривается задача деидентификации говорящего (или голоса) путем представления нового подхода к сокрытию личности говорящих в их речи. Предлагаемый метод сначала распознает входную речь с помощью системы распознавания дифонов, а затем преобразует полученную фонетическую транскрипцию в речь другого говорящего с помощью системы синтеза речи. Поскольку при деидентификации используются этап распознавания дифонов (Diphone RecOgnition) и этап синтеза речи (sPeech SYnthesis), разработанный метод обозначается как DROPSY. В рамках этого подхода акустические модели модулей распознавания и синтеза полностью независимы друг от друга, что обеспечивает максимально высокий уровень деидентификации исходного говорящего. Предлагаемый подход к деидентификации на основе DROPSY является языко-зависимым, текстонезависимым и способен работать в реальном времени благодаря относительно простым используемым вычислительным методам. При разработке технологий деидентификации говорящего к методам деидентификации обычно предъявляются два требования: (i) невозможность установить личность говорящих на основе деидентифицированной речи и (ii) сохранение естественности и разборчивости обработанной речи. Поэтому в статье предлагаемый подход на основе DROPSY реализован с использованием двух различных методов синтеза речи: метода на основе скрытых марковских моделей (HMM) и метода на основе дифонов TD-PSOLA. Полученная деидентифицированная речь оценивается по разборчивости, а также в экспериментах по верификации говорящего с использованием современной системы распознавания говорящего на основе i-векторов и PLDA. Сравнение обоих модулей синтеза речи, интегрированных в предлагаемый метод, показывает, что каждый из них способен эффективно деидентифицировать исходных говорящих, одновременно обеспечивая разборчивость синтезированной речи.
1
Оба варианта синтеза — на основе HMM и дифонного TD-PSOLA — эффективно обезличивают говорящих, сохраняя разборчивость речи.
2
DROPSY обезличивает говорящих, распознавая речь в виде фонетической транскрипции на основе дифонов и синтезируя её голосом другого говорящего.
3
Обезличенная речь оценивалась по разборчивости и в экспериментах верификации говорящего с использованием системы i-vector/PLDA.
4
Независимые акустические модели распознавания и синтеза обеспечивают максимальное сокрытие личности исходного говорящего.
5
Метод зависит от языка, не зависит от текста и пригоден для работы в реальном времени благодаря относительно простым вычислительным процедурам.

деидентификация говорящего во входной речи с использованием подхода DROPSY на основе распознавания дифонов и синтеза речи

эффективность синтеза речи на основе HMM и дифонного TD-PSOLA для сокрытия личности говорящего при сохранении разборчивости и естественности речи

Publication Details
Publication Date
2015-05-01
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Tadej Justin
Vitomir Štruc
Simon Dobrišek
Boštjan Vesnicer
Ivo Ipšić
France Mihelič
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%