Эффективность характеристик речевого сигнала, основанных на линейном предсказании, для автоматической идентификации и верификации диктора

Effectiveness of linear prediction characteristics of the speech wave for automatic speaker identification and verification
Bishnu S. Atal
1974-06-01

кепстрлинейное предсказаниеидентификация говорящеговерификация говорящеготекстонезависимое распознавание
Исследована эффективность нескольких параметрических представлений речи, полученных на основе модели линейного предсказания, для автоматического распознавания дикторов по голосу. Для речевого сигнала, дискретизированного с частотой 10 кГц, приблизительно каждые 50 мс определяли двенадцать коэффициентов предсказания. Коэффициенты предсказания и другие речевые параметры, производные от них, такие как импульсная характеристика, автокорреляционная функция, функция площади и кепстральная функция, использовали в качестве входных данных системы автоматического распознавания диктора. Речевые данные включали 60 высказываний: по шесть повторений одного и того же предложения, произнесенного каждым из 10 дикторов. Решение об идентификации основывалось на расстоянии между вектором тестового образца и опорным вектором каждого диктора в совокупности; неизвестным диктором считали диктора, которому соответствовал опорный вектор с наименьшим расстоянием. При верификации диктор считался подтвержденным, если расстояние между вектором тестового образца и опорным вектором заявленного диктора было меньше фиксированного порога. Среди всех исследованных параметров наиболее эффективным оказался кепстр: точность идентификации составила 70% для речевого сигнала длительностью 50 мс и увеличилась до более чем 98% при длительности 0,5 с. Для тех же речевых данных точность верификации составляла приблизительно 83% при длительности 50 мс и возрастала до 98% при длительности 1 с. В отдельном исследовании, посвященном оценке возможности текстонезависимой идентификации диктора, для речевого сигнала длительностью 2 с была достигнута точность идентификации 93%, несмотря на различие текстов тестовых и опорных образцов.
1
Среди исследованных представлений наиболее эффективным для идентификации говорящего оказался кепстр: точность составила 70% для 50 мс речи и превысила 98% для 0,5 с речи.
2
Идентификация выполнялась по минимальному расстоянию до эталонного вектора, а верификация принимала заявленного говорящего, если расстояние было ниже фиксированного порога.
3
Точность верификации говорящего составила примерно 83% для 50 мс речи и возросла до 98% для 1 с речи на тех же данных.
4
При текстонезависимой идентификации говорящего точность достигла 93% для образцов длительностью 2 с, несмотря на различие текстов тестовых и эталонных образцов.
5
В исследовании оцениваются различные представления речевого сигнала на основе линейного предсказания для автоматической идентификации и верификации говорящего с использованием речи, дискретизированной на частоте 10 кГц, и 12 коэффициентов предсказания, вычисляемых каждые 50 мс.

речевые сигналы нескольких дикторов, представленные параметрами, производными от линейного предсказания

эффективность параметров речи, производных от линейного предсказания, для автоматической идентификации и верификации диктора

Publication Details
Publication Date
1974-06-01
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Bishnu S. Atal
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%