AST: Трансформер аудиоспектрограммы
AST: Audio Spectrogram Transformer
2021-08-27
SCID: 54.1/59d3nvqf
Discuss with AI
Audio Spectrogram TransformerAudioSetклассификация аудиобез свертокчисто на основе внимания
Figures from the paper
Abstract (AI)
За последнее десятилетие сверточные нейронные сети (CNN) широко использовались в качестве основного конструктивного элемента для сквозных моделей классификации аудио, которые стремятся научиться напрямую сопоставлять аудиоспектрограммы с соответствующими метками. Чтобы лучше захватывать дальнодействующий глобальный контекст, в последнее время стало популярно добавлять механизм самовнимания поверх CNN, формируя гибридную модель CNN+attention. Однако остается неясным, является ли зависимость от CNN необходимой и достаточно ли нейронных сетей, основанных исключительно на механизме внимания, для достижения хорошей производительности в классификации аудио. В этой работе мы отвечаем на этот вопрос, вводя Audio Spectrogram Transformer (AST) — первую безсверточную, полностью основанную на внимании модель для классификации аудио. Мы оцениваем AST на различных бенчмарках по классификации аудио, где она достигает новых рекордных результатов: 0.485 mAP на AudioSet, 95.6% точности на ESC-50 и 98.1% точности на Speech Commands V2.
Key Findings
1
AST достигает рекордного результата 0.485 mean average precision (mAP) на бенчмарке AudioSet.
2
AST показывает точность 95.6% на бенчмарке ESC-50 для классификации звуков окружающей среды.
3
AST показывает точность 98.1% на бенчмарке Speech Commands V2 для распознавания команд.
4
Показано, что модели, основанные только на внимании (без CNN), достаточны для высокой производительности в классификации аудио, ставя под вопрос необходимость использования CNN.
5
Представлен Audio Spectrogram Transformer (AST) — первая безсвёрточная модель для классификации аудио, основанная исключительно на механизме внимания.
Research Object
Модель Audio Spectrogram Transformer (AST)
Research Subject
Работоспособность и эффективность безсверточной, полностью основанной на механизме внимания модели для классификации аудио по спектрограммам (включая эталонные метрики на AudioSet, ESC-50 и Speech Commands V2)
Publication Details
Publication Date
2021-08-27
Journal
Publisher
ISSN
Cited by
1077
Access Type
Author Information
Download PDF
Subscribe to digest