Изображение стоит 16×16 слов: трансформеры для распознавания изображений в масштабе
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
2020-10-22
SCID: 54.1/n8ujjgcs
Discuss with AI
ImageNetVision Transformerклассификация изображенийфрагменты изображенияпредобучение на больших данных
Figures from the paper
Abstract (AI)
Хотя архитектура Transformer стала де-факто стандартом для задач обработки естественного языка, её приложения в компьютерном зрении остаются ограниченными. В задачах зрения механизм внимания либо применяется совместно с сверточными нейронными сетями (CNN), либо используется для замены отдельных компонентов CNN при сохранении их общей структуры. Мы показываем, что такая зависимость от CNN не обязательна: чистый трансформер, применённый напрямую к последовательностям фрагментов (патчей) изображения, может показывать очень хорошие результаты в задачах классификации изображений. При предварительном обучении на больших объёмах данных и переносе на несколько средних или небольших бенчмарков по распознаванию изображений (ImageNet, CIFAR-100, VTAB и др.) Vision Transformer (ViT) достигает выдающихся результатов по сравнению с современными сверточными сетями при заметно меньших вычислительных затратах на обучение.
Key Findings
1
Чистый трансформер, применённый напрямую к последовательностям патчей изображения (Vision Transformer, ViT), может очень хорошо справляться с задачами классификации изображений.
2
ViT не требует сверточных нейронных сетей; зависимость от CNNs не обязательна для хорошей производительности в задачах компьютерного зрения.
3
ViT требует значительно меньше вычислительных ресурсов для обучения, чем современные сверточные сети при достижении сопоставимой производительности.
4
При предварительной обучении на больших данных и переносе на средние или маленькие наборы (ImageNet, CIFAR-100, VTAB) ViT показывает отличные результаты по сравнению с современными сверточными сетями.
Research Object
Vision Transformer (чистая архитектура Transformer, применённая к последовательностям фрагментов изображения для классификации)
Research Subject
Эффективность и производительность чистой архитектуры Transformer, применённой к последовательностям фрагментов изображения для распознавания изображений при масштабном предобучении и переносе на средние и небольшие бенчмарки (например, ImageNet, CIFAR-100, VTAB), включая эффективность использования вычислительных ресурсов при обучении по сравнению с современными сверточными сетями
Publication Details
Publication Date
2020-10-22
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai7
Обучение нескольких слоев признаков на маленьких изображениях2024
Обучение глубоких моделей Transformer для машинного перевода2019
Нелокальные нейронные сети2018
Классификация ImageNet с использованием глубоких сверточных нейронных сетей2017
Глубокое остаточное обучение для распознавания изображений2016
Adam: метод стохастической оптимизации2015
ImageNet: крупномасштабная иерархическая база изображений2009
Работы, цитирующие эту статью20
Swin Transformer: Иерархический визуальный трансформер с использова́нием сдвинутых окон2021
Появляющиеся свойства самоконтролируемых Vision Transformer2021
Pyramid Vision Transformer: универсальный бэкоун для плотного предсказания без свёрток2021
SwinIR: восстановление изображений с использованием Swin Transformer2021
Restormer: эффективный Transformer для восстановления изображений высокого разрешения2022
Переосмысление семантической сегментации с точки зрения sequence-to-sequence на основе трансформеров2021
SegFormer: простая и эффективная архитектура для семантической сегментации с использованием трансформеров2021
UNETR: Трансформеры для 3D сегментации медицинских изображений2022
Point Transformer2021
Swin Transformer V2: увеличение ёмкости и разрешения2022
PVT v2: Улучшённые базовые модели с Pyramid Vision Transformer2022
Tokens-to-Token ViT: обучение визуальных трансформеров с нуля на ImageNet2021
Беги, не иди: в поисках более высокой FLOPS для более быстрых нейронных сетей2023
Uformer: Общая U-образная трансформерная архитектура для восстановления изображений2022
TPH-YOLOv5: Улучшенный YOLOv5 с трансформерной головой предсказания для обнаружения объектов на снимках с дронов2021
Предобученный трансформер для обработки изображений2021
Video Swin Transformer2022
CrossViT: мультишкальный визуальный трансформер с перекрёстным вниманием для классификации изображений2021
LoFTR: локальное сопоставление признаков без детектора с использованием трансформеров2021
Эмпирическое исследование обучения самоконтролируемых Vision Transformer2021