AST: Трансформер аудиоспектрограммы

AST: Audio Spectrogram Transformer
James Glass, Yuan Gong, Yu-An Chung
2021-08-27

Audio Spectrogram TransformerAudioSetклассификация аудиобез свертокчисто на основе внимания
За последнее десятилетие сверточные нейронные сети (CNN) широко использовались в качестве основного конструктивного элемента для сквозных моделей классификации аудио, которые стремятся научиться напрямую сопоставлять аудиоспектрограммы с соответствующими метками. Чтобы лучше захватывать дальнодействующий глобальный контекст, в последнее время стало популярно добавлять механизм самовнимания поверх CNN, формируя гибридную модель CNN+attention. Однако остается неясным, является ли зависимость от CNN необходимой и достаточно ли нейронных сетей, основанных исключительно на механизме внимания, для достижения хорошей производительности в классификации аудио. В этой работе мы отвечаем на этот вопрос, вводя Audio Spectrogram Transformer (AST) — первую безсверточную, полностью основанную на внимании модель для классификации аудио. Мы оцениваем AST на различных бенчмарках по классификации аудио, где она достигает новых рекордных результатов: 0.485 mAP на AudioSet, 95.6% точности на ESC-50 и 98.1% точности на Speech Commands V2.
1
AST достигает рекордного результата 0.485 mean average precision (mAP) на бенчмарке AudioSet.
2
AST показывает точность 95.6% на бенчмарке ESC-50 для классификации звуков окружающей среды.
3
AST показывает точность 98.1% на бенчмарке Speech Commands V2 для распознавания команд.
4
Показано, что модели, основанные только на внимании (без CNN), достаточны для высокой производительности в классификации аудио, ставя под вопрос необходимость использования CNN.
5
Представлен Audio Spectrogram Transformer (AST) — первая безсвёрточная модель для классификации аудио, основанная исключительно на механизме внимания.

Модель Audio Spectrogram Transformer (AST)

Работоспособность и эффективность безсверточной, полностью основанной на механизме внимания модели для классификации аудио по спектрограммам (включая эталонные метрики на AudioSet, ESC-50 и Speech Commands V2)

Publication Details
Publication Date
2021-08-27
Journal
Publisher
ISSN
Cited by
1077
Access Type
Author Information
Authors
James Glass
Yuan Gong
Yu-An Chung
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%