SSAST: аудиоспектрограммный трансформер с самоконтролируемым обучением
SSAST: Self-Supervised Audio Spectrogram Transformer
2022-06-28
SCID: 54.1/cqg7urca
Discuss with AI
Audio Spectrogram Transformerклассификация аудиораспознавание ключевых словмоделирование замаскированных спектрограммных патчейсамообучение
Figures from the paper
Abstract (AI)
Недавно было показано, что нейронные сети, основанные исключительно на механизме самовнимания, такие как Vision Transformer (ViT), превосходят модели глубокого обучения, построенные на сверточных нейронных сетях (CNN), в различных задачах компьютерного зрения, что расширяет успех трансформеров, первоначально разработанных для обработки языка, на область зрения. Недавнее исследование показало, что аналогичная методология может применяться и в аудиодомене. В частности, Audio Spectrogram Transformer (AST) достигает передовых результатов на различных эталонных наборах данных для классификации аудио. Однако чистые трансформерные модели, как правило, требуют большего объема обучающих данных по сравнению с CNN, а успех AST опирается на обучение с учителем на этапе предварительного обучения, требующее большого количества размеченных данных и сложного конвейера обучения, что ограничивает практическое применение AST. В данной статье рассматриваются задачи классификации аудио и речи; ее цель — снизить потребность AST в больших объемах размеченных данных за счет самоконтролируемого обучения на неразмеченных данных. В частности, предлагается предварительно обучать модель AST с использованием совместного дискриминативного и генеративного моделирования замаскированных фрагментов спектрограммы (MSPM) на неразмеченных аудиоданных из AudioSet и Librispeech. Мы оцениваем предварительно обученные модели на задачах классификации аудио и речи, включая классификацию аудиособытий, распознавание ключевых слов, распознавание эмоций и идентификацию говорящего. Предложенная самоконтролируемая структура значительно повышает производительность AST во всех задачах: среднее улучшение составляет 60,9%, благодаря чему достигаются результаты, сопоставимые с результатами AST, предварительно обученного с учителем, или превосходящие их. Насколько нам известно, это первая основанная на фрагментах структура самоконтролируемого обучения в области аудио и речи, а также первая структура самоконтролируемого обучения для AST.
Key Findings
1
SSAST обеспечивает среднее улучшение на 60,9% по оценённым задачам, достигая результатов, сопоставимых с результатами AST с учительским предобучением или превосходя их.
2
SSAST предварительно обучает Audio Spectrogram Transformer на неразмеченных данных AudioSet и Librispeech, снижая зависимость от больших размеченных наборов данных.
3
Самосупервизированное предобучение существенно повышает качество AST в классификации аудиособытий, обнаружении ключевых слов, распознавании эмоций и идентификации говорящего.
4
Метод совместно использует дискриминативное и генеративное моделирование замаскированных спектрограммных патчей для самосупервизированного предобучения AST.
5
Работа представляет первый patch-based самосупервизированный метод обучения для аудио и речи, а также первый самосупервизированный подход специально для AST.
Research Object
модели Audio Spectrogram Transformer (AST) для классификации аудио и речи, предварительно обученные на неразмеченных аудиоданных
Research Subject
влияние самоконтролируемого совместного дискриминативного и генеративного моделирования замаскированных фрагментов спектрограмм на эффективность классификации с помощью AST и потребность в размеченных данных
Publication Details
Publication Date
2022-06-28
Journal
Publisher
ISSN
Cited by
284
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest