Сквозная верификация дикторов с использованием взвешенной бинарной кросс-энтропии на основе бипартитного ранжирования и обучения по принципу усложнения задач

End-to-End Speaker Verification via Curriculum Bipartite Ranking Weighted Binary Cross-Entropy
Zhongxin Bai, Xiao-Lei Zhang, Jingdong Chen, Jianyu Wang
2022-01-01

двудольное ранжированиеобучение с постепенным усложнениемсквозная верификация говорящегодисбаланс испытанийвзвешенная бинарная кросс-энтропия
Сквозная верификация дикторов непосредственно оценивает оценку сходства для пары речевых высказываний, формулируя задачу верификации как задачу бинарной классификации, включающую целевые и нецелевые пробы. В отличие от поэтапных методов, сквозной подход к верификации непосредственно оптимизирует метрики оценки, а его выходной слой не содержит параметров, что позволяет существенно сократить затраты вычислительных и memory ресурсов. Однако при обучении модели сквозной верификации дикторов необходимо тщательно решать две важные проблемы. Первая заключается в обработке сильно несбалансированных проб, когда число целевых проб значительно меньше числа нецелевых; вторая связана с обработкой простых проб, которые не способствуют улучшению модели в процессе обучения. Для решения этих проблем мы предлагаем функцию потерь типа бинарной кросс-энтропии (BCE) и метод обучения моделей глубоких нейронных сетей (DNN) для сквозной верификации дикторов на основе этой функции потерь. В процессе обучения применяется бипартитное ранжирование для устранения дисбаланса проб и обучение по принципу усложнения задач для повышения стабильности обучения и качества модели посредством постепенного отбора нецелевых проб — от простых к сложным — по мере сходимости. Поскольку процесс обучения включает бипартитное ранжирование и обучение по принципу усложнения задач, а функция потерь имеет обобщённую форму BCE, предложенный подход получил название «взвешенная бинарная кросс-энтропия на основе бипартитного ранжирования и обучения по принципу усложнения задач» (CBRW-BCE). Экспериментальные результаты показывают, что модель, обученная с использованием CBRW-BCE, не только достигает передовых результатов, но и обладает хорошей калибровкой.
1
Бипартитное ранжирование устраняет сильный дисбаланс между целевыми и нецелевыми испытаниями при обучении.
2
При курriculum-обучении нецелевые испытания постепенно отбираются от простых к сложным, что повышает стабильность обучения и качество модели.
3
Сквозная постановка напрямую оптимизирует метрики верификации и использует параметр-свободный выходной слой, снижая требования к вычислительным ресурсам и памяти по сравнению с поэтапными методами.
4
В работе предложена CBRW-BCE — обобщённая функция бинарной кросс-энтропии для сквозной верификации говорящего.
5
Модель, обученная с помощью CBRW-BCE, достигает передовых результатов верификации говорящего и обеспечивает хорошо калиброванные оценки.

модели сквозной верификации говорящего, работающие с парами целевых и нецелевых высказываний

влияние сильного дисбаланса и простоты испытаний на обучение, а также результирующие характеристики верификации, стабильность и калибровка

Publication Details
Publication Date
2022-01-01
Journal
Publisher
ISSN
Cited by
37
Access Type
Author Information
Authors
Zhongxin Bai
Xiao-Lei Zhang
Jingdong Chen
Jianyu Wang
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%