Изображение стоит 16×16 слов: трансформеры для распознавания изображений в масштабе

An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
Jakob Uszkoreit, Xiaohua Zhai, Alexander Kolesnikov, Neil Houlsby, Lucas Beyer, Alexey Dosovitskiy, Dirk Weissenborn, Thomas Unterthiner, Mostafa Dehghani, Matthias Minderer, Georg Heigold, Sylvain Gelly
2020-10-22

ImageNetVision Transformerклассификация изображенийфрагменты изображенияпредобучение на больших данных
Хотя архитектура Transformer стала де-факто стандартом для задач обработки естественного языка, её приложения в компьютерном зрении остаются ограниченными. В задачах зрения механизм внимания либо применяется совместно с сверточными нейронными сетями (CNN), либо используется для замены отдельных компонентов CNN при сохранении их общей структуры. Мы показываем, что такая зависимость от CNN не обязательна: чистый трансформер, применённый напрямую к последовательностям фрагментов (патчей) изображения, может показывать очень хорошие результаты в задачах классификации изображений. При предварительном обучении на больших объёмах данных и переносе на несколько средних или небольших бенчмарков по распознаванию изображений (ImageNet, CIFAR-100, VTAB и др.) Vision Transformer (ViT) достигает выдающихся результатов по сравнению с современными сверточными сетями при заметно меньших вычислительных затратах на обучение.
1
Чистый трансформер, применённый напрямую к последовательностям патчей изображения (Vision Transformer, ViT), может очень хорошо справляться с задачами классификации изображений.
2
ViT не требует сверточных нейронных сетей; зависимость от CNNs не обязательна для хорошей производительности в задачах компьютерного зрения.
3
ViT требует значительно меньше вычислительных ресурсов для обучения, чем современные сверточные сети при достижении сопоставимой производительности.
4
При предварительной обучении на больших данных и переносе на средние или маленькие наборы (ImageNet, CIFAR-100, VTAB) ViT показывает отличные результаты по сравнению с современными сверточными сетями.

Vision Transformer (чистая архитектура Transformer, применённая к последовательностям фрагментов изображения для классификации)

Эффективность и производительность чистой архитектуры Transformer, применённой к последовательностям фрагментов изображения для распознавания изображений при масштабном предобучении и переносе на средние и небольшие бенчмарки (например, ImageNet, CIFAR-100, VTAB), включая эффективность использования вычислительных ресурсов при обучении по сравнению с современными сверточными сетями

Publication Details
Publication Date
2020-10-22
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Jakob Uszkoreit
Xiaohua Zhai
Alexander Kolesnikov
Neil Houlsby
Lucas Beyer
Alexey Dosovitskiy
Dirk Weissenborn
Thomas Unterthiner
Mostafa Dehghani
Matthias Minderer
Georg Heigold
Sylvain Gelly
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%