SSAST: аудиоспектрограммный трансформер с самоконтролируемым обучением

SSAST: Self-Supervised Audio Spectrogram Transformer
James Glass, Yuan Gong, Yu-An Chung, Cheng-I Lai
2022-06-28

Audio Spectrogram Transformerклассификация аудиораспознавание ключевых словмоделирование замаскированных спектрограммных патчейсамообучение
Недавно было показано, что нейронные сети, основанные исключительно на механизме самовнимания, такие как Vision Transformer (ViT), превосходят модели глубокого обучения, построенные на сверточных нейронных сетях (CNN), в различных задачах компьютерного зрения, что расширяет успех трансформеров, первоначально разработанных для обработки языка, на область зрения. Недавнее исследование показало, что аналогичная методология может применяться и в аудиодомене. В частности, Audio Spectrogram Transformer (AST) достигает передовых результатов на различных эталонных наборах данных для классификации аудио. Однако чистые трансформерные модели, как правило, требуют большего объема обучающих данных по сравнению с CNN, а успех AST опирается на обучение с учителем на этапе предварительного обучения, требующее большого количества размеченных данных и сложного конвейера обучения, что ограничивает практическое применение AST. В данной статье рассматриваются задачи классификации аудио и речи; ее цель — снизить потребность AST в больших объемах размеченных данных за счет самоконтролируемого обучения на неразмеченных данных. В частности, предлагается предварительно обучать модель AST с использованием совместного дискриминативного и генеративного моделирования замаскированных фрагментов спектрограммы (MSPM) на неразмеченных аудиоданных из AudioSet и Librispeech. Мы оцениваем предварительно обученные модели на задачах классификации аудио и речи, включая классификацию аудиособытий, распознавание ключевых слов, распознавание эмоций и идентификацию говорящего. Предложенная самоконтролируемая структура значительно повышает производительность AST во всех задачах: среднее улучшение составляет 60,9%, благодаря чему достигаются результаты, сопоставимые с результатами AST, предварительно обученного с учителем, или превосходящие их. Насколько нам известно, это первая основанная на фрагментах структура самоконтролируемого обучения в области аудио и речи, а также первая структура самоконтролируемого обучения для AST.
1
SSAST обеспечивает среднее улучшение на 60,9% по оценённым задачам, достигая результатов, сопоставимых с результатами AST с учительским предобучением или превосходя их.
2
SSAST предварительно обучает Audio Spectrogram Transformer на неразмеченных данных AudioSet и Librispeech, снижая зависимость от больших размеченных наборов данных.
3
Самосупервизированное предобучение существенно повышает качество AST в классификации аудиособытий, обнаружении ключевых слов, распознавании эмоций и идентификации говорящего.
4
Метод совместно использует дискриминативное и генеративное моделирование замаскированных спектрограммных патчей для самосупервизированного предобучения AST.
5
Работа представляет первый patch-based самосупервизированный метод обучения для аудио и речи, а также первый самосупервизированный подход специально для AST.

модели Audio Spectrogram Transformer (AST) для классификации аудио и речи, предварительно обученные на неразмеченных аудиоданных

влияние самоконтролируемого совместного дискриминативного и генеративного моделирования замаскированных фрагментов спектрограмм на эффективность классификации с помощью AST и потребность в размеченных данных

Publication Details
Publication Date
2022-06-28
Journal
Publisher
ISSN
Cited by
284
Access Type
Author Information
Authors
James Glass
Yuan Gong
Yu-An Chung
Cheng-I Lai
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%