Сквозная верификация дикторов с использованием взвешенной бинарной кросс-энтропии на основе бипартитного ранжирования и обучения по принципу усложнения задач
End-to-End Speaker Verification via Curriculum Bipartite Ranking Weighted Binary Cross-Entropy
2022-01-01
SCID: 54.1/f3krsnct
Discuss with AI
двудольное ранжированиеобучение с постепенным усложнениемсквозная верификация говорящегодисбаланс испытанийвзвешенная бинарная кросс-энтропия
Figures from the paper
Abstract (AI)
Сквозная верификация дикторов непосредственно оценивает оценку сходства для пары речевых высказываний, формулируя задачу верификации как задачу бинарной классификации, включающую целевые и нецелевые пробы. В отличие от поэтапных методов, сквозной подход к верификации непосредственно оптимизирует метрики оценки, а его выходной слой не содержит параметров, что позволяет существенно сократить затраты вычислительных и memory ресурсов. Однако при обучении модели сквозной верификации дикторов необходимо тщательно решать две важные проблемы. Первая заключается в обработке сильно несбалансированных проб, когда число целевых проб значительно меньше числа нецелевых; вторая связана с обработкой простых проб, которые не способствуют улучшению модели в процессе обучения. Для решения этих проблем мы предлагаем функцию потерь типа бинарной кросс-энтропии (BCE) и метод обучения моделей глубоких нейронных сетей (DNN) для сквозной верификации дикторов на основе этой функции потерь. В процессе обучения применяется бипартитное ранжирование для устранения дисбаланса проб и обучение по принципу усложнения задач для повышения стабильности обучения и качества модели посредством постепенного отбора нецелевых проб — от простых к сложным — по мере сходимости. Поскольку процесс обучения включает бипартитное ранжирование и обучение по принципу усложнения задач, а функция потерь имеет обобщённую форму BCE, предложенный подход получил название «взвешенная бинарная кросс-энтропия на основе бипартитного ранжирования и обучения по принципу усложнения задач» (CBRW-BCE). Экспериментальные результаты показывают, что модель, обученная с использованием CBRW-BCE, не только достигает передовых результатов, но и обладает хорошей калибровкой.
Key Findings
1
Бипартитное ранжирование устраняет сильный дисбаланс между целевыми и нецелевыми испытаниями при обучении.
2
При курriculum-обучении нецелевые испытания постепенно отбираются от простых к сложным, что повышает стабильность обучения и качество модели.
3
Сквозная постановка напрямую оптимизирует метрики верификации и использует параметр-свободный выходной слой, снижая требования к вычислительным ресурсам и памяти по сравнению с поэтапными методами.
4
В работе предложена CBRW-BCE — обобщённая функция бинарной кросс-энтропии для сквозной верификации говорящего.
5
Модель, обученная с помощью CBRW-BCE, достигает передовых результатов верификации говорящего и обеспечивает хорошо калиброванные оценки.
Research Object
модели сквозной верификации говорящего, работающие с парами целевых и нецелевых высказываний
Research Subject
влияние сильного дисбаланса и простоты испытаний на обучение, а также результирующие характеристики верификации, стабильность и калибровка
Publication Details
Publication Date
2022-01-01
Journal
Publisher
ISSN
Cited by
37
Access Type
Author Information
Download PDF
Subscribe to digest