Сравнение Vision Transformers и сверточных нейронных сетей для классификации изображений: обзор литературы
Comparing Vision Transformers and Convolutional Neural Networks for Image Classification: A Literature Review
2023-04-28
SCID: 54.1/crqskc3y
Discuss with AI
сверточные нейронные сетимногоголовое вниманиеVision Transformersархитектуры глубокого обученияклассификация изображений
Figures from the paper
Abstract (AI)
Трансформеры — это модели, реализующие механизм самовнимания, который позволяет индивидуально взвешивать важность каждой части входных данных. Их применение в задачах классификации изображений по-прежнему несколько ограничено, поскольку исследователи традиционно выбирали сверточные нейронные сети для классификации изображений, тогда как трансформеры преимущественно использовались для задач обработки естественного языка (NLP). Поэтому в данной статье представлен обзор литературы, демонстрирующий различия между Vision Transformers (ViT) и сверточными нейронными сетями. Был рассмотрен современный уровень исследований, в которых обе архитектуры применялись для классификации изображений, а также предпринята попытка определить, какие факторы могут влиять на производительность этих двух архитектур глубокого обучения, с учетом используемых наборов данных, размера изображений, числа целевых классов в задачах классификации, аппаратного обеспечения, исследованных архитектур и достигнутых лучших результатов. Цель работы — определить, какая из архитектур лучше подходит для классификации изображений и в каких условиях. В статье также описывается важность механизма многоголового внимания для повышения производительности ViT при классификации изображений.
Key Findings
1
В работе исследуется, какая архитектура показывает лучшие результаты при разных экспериментальных условиях, без предположения о безусловном превосходстве одной модели.
2
Лучшие результаты анализируются вместе с факторами набора данных и реализации, влияющими на сравнительную производительность архитектур.
3
Подчеркивается важность механизма многоголового внимания для повышения эффективности Vision Transformers в классификации изображений.
4
В обзоре рассматривается относительно ограниченное применение Vision Transformers в классификации изображений по сравнению с традиционно предпочитаемыми CNN.
5
Обзор сравнивает Vision Transformers и сверточные нейронные сети для классификации изображений с учетом наборов данных, размера изображений, числа классов, аппаратного обеспечения и архитектур.
Research Object
Vision Transformer и сверточные нейронные сети, применяемые для классификации изображений
Research Subject
Сравнительная эффективность Vision Transformer и сверточных нейронных сетей при классификации изображений и влияющие на нее условия, включая роль механизма Multi-Head Attention
Publication Details
Publication Date
2023-04-28
Journal
Publisher
ISSN
Cited by
574
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest