Эффективность характеристик речевого сигнала, основанных на линейном предсказании, для автоматической идентификации и верификации диктора
Effectiveness of linear prediction characteristics of the speech wave for automatic speaker identification and verification
1974-06-01
SCID: 54.1/pzf3exev
Discuss with AI
кепстрлинейное предсказаниеидентификация говорящеговерификация говорящеготекстонезависимое распознавание
Figures from the paper
Abstract (AI)
Исследована эффективность нескольких параметрических представлений речи, полученных на основе модели линейного предсказания, для автоматического распознавания дикторов по голосу. Для речевого сигнала, дискретизированного с частотой 10 кГц, приблизительно каждые 50 мс определяли двенадцать коэффициентов предсказания. Коэффициенты предсказания и другие речевые параметры, производные от них, такие как импульсная характеристика, автокорреляционная функция, функция площади и кепстральная функция, использовали в качестве входных данных системы автоматического распознавания диктора. Речевые данные включали 60 высказываний: по шесть повторений одного и того же предложения, произнесенного каждым из 10 дикторов. Решение об идентификации основывалось на расстоянии между вектором тестового образца и опорным вектором каждого диктора в совокупности; неизвестным диктором считали диктора, которому соответствовал опорный вектор с наименьшим расстоянием. При верификации диктор считался подтвержденным, если расстояние между вектором тестового образца и опорным вектором заявленного диктора было меньше фиксированного порога. Среди всех исследованных параметров наиболее эффективным оказался кепстр: точность идентификации составила 70% для речевого сигнала длительностью 50 мс и увеличилась до более чем 98% при длительности 0,5 с. Для тех же речевых данных точность верификации составляла приблизительно 83% при длительности 50 мс и возрастала до 98% при длительности 1 с. В отдельном исследовании, посвященном оценке возможности текстонезависимой идентификации диктора, для речевого сигнала длительностью 2 с была достигнута точность идентификации 93%, несмотря на различие текстов тестовых и опорных образцов.
Key Findings
1
Среди исследованных представлений наиболее эффективным для идентификации говорящего оказался кепстр: точность составила 70% для 50 мс речи и превысила 98% для 0,5 с речи.
2
Идентификация выполнялась по минимальному расстоянию до эталонного вектора, а верификация принимала заявленного говорящего, если расстояние было ниже фиксированного порога.
3
Точность верификации говорящего составила примерно 83% для 50 мс речи и возросла до 98% для 1 с речи на тех же данных.
4
При текстонезависимой идентификации говорящего точность достигла 93% для образцов длительностью 2 с, несмотря на различие текстов тестовых и эталонных образцов.
5
В исследовании оцениваются различные представления речевого сигнала на основе линейного предсказания для автоматической идентификации и верификации говорящего с использованием речи, дискретизированной на частоте 10 кГц, и 12 коэффициентов предсказания, вычисляемых каждые 50 мс.
Research Object
речевые сигналы нескольких дикторов, представленные параметрами, производными от линейного предсказания
Research Subject
эффективность параметров речи, производных от линейного предсказания, для автоматической идентификации и верификации диктора
Publication Details
Publication Date
1974-06-01
Journal
Publisher
ISSN
Access Type
Author Information
Download PDF
Subscribe to digest