Сравнение Vision Transformers и сверточных нейронных сетей для классификации изображений: обзор литературы

Comparing Vision Transformers and Convolutional Neural Networks for Image Classification: A Literature Review
José Maurício, Inês Domingues, Jorge Bernardino
2023-04-28

сверточные нейронные сетимногоголовое вниманиеVision Transformersархитектуры глубокого обученияклассификация изображений
Трансформеры — это модели, реализующие механизм самовнимания, который позволяет индивидуально взвешивать важность каждой части входных данных. Их применение в задачах классификации изображений по-прежнему несколько ограничено, поскольку исследователи традиционно выбирали сверточные нейронные сети для классификации изображений, тогда как трансформеры преимущественно использовались для задач обработки естественного языка (NLP). Поэтому в данной статье представлен обзор литературы, демонстрирующий различия между Vision Transformers (ViT) и сверточными нейронными сетями. Был рассмотрен современный уровень исследований, в которых обе архитектуры применялись для классификации изображений, а также предпринята попытка определить, какие факторы могут влиять на производительность этих двух архитектур глубокого обучения, с учетом используемых наборов данных, размера изображений, числа целевых классов в задачах классификации, аппаратного обеспечения, исследованных архитектур и достигнутых лучших результатов. Цель работы — определить, какая из архитектур лучше подходит для классификации изображений и в каких условиях. В статье также описывается важность механизма многоголового внимания для повышения производительности ViT при классификации изображений.
1
В работе исследуется, какая архитектура показывает лучшие результаты при разных экспериментальных условиях, без предположения о безусловном превосходстве одной модели.
2
Лучшие результаты анализируются вместе с факторами набора данных и реализации, влияющими на сравнительную производительность архитектур.
3
Подчеркивается важность механизма многоголового внимания для повышения эффективности Vision Transformers в классификации изображений.
4
В обзоре рассматривается относительно ограниченное применение Vision Transformers в классификации изображений по сравнению с традиционно предпочитаемыми CNN.
5
Обзор сравнивает Vision Transformers и сверточные нейронные сети для классификации изображений с учетом наборов данных, размера изображений, числа классов, аппаратного обеспечения и архитектур.

Vision Transformer и сверточные нейронные сети, применяемые для классификации изображений

Сравнительная эффективность Vision Transformer и сверточных нейронных сетей при классификации изображений и влияющие на нее условия, включая роль механизма Multi-Head Attention

Publication Details
Publication Date
2023-04-28
Journal
Publisher
ISSN
Cited by
574
Access Type
Author Information
Authors
José Maurício
Inês Domingues
Jorge Bernardino
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%