Swin Transformer: Иерархический визуальный трансформер с использова́нием сдвинутых окон
Swin Transformer: Hierarchical Vision Transformer using Shifted Windows
2021-10-01
SCID: 54.1/7fdha76b
Discuss with AI
иерархический трансформерсдвинутые окнаSwin Transformerклассификация изображений (ImageNet-1K)детекция объектов и сегментация инстансов (COCO)
Figures from the paper
Abstract (AI)
В статье представлен новый визуальный трансформер под названием Swin Transformer, который служит универсальным базовым модулем для задач компьютерного зрения. Адаптация трансформера из области языка к области зрения осложняется различиями между этими доменами, такими как большие вариации в масштабе визуальных объектов и более высокое разрешение пикселей в изображениях по сравнению со словами в тексте. Для учета этих различий мы предлагаем иерархический трансформер, представления в котором вычисляются с использованием сдвинутых окон. Схема со сдвинутыми окнами повышает эффективность за счет ограничения вычислений self-attention неперекрывающимися локальными окнами при одновременном обеспечении связей между окнами. Эта иерархическая архитектура обладает гибкостью моделирования на различных масштабах и имеет линейную вычислительную сложность относительно размера изображения. Эти свойства Swin Transformer делают его совместимым с широким спектром задач зрения, включая классификацию изображений (87.3% top-1 на ImageNet-1K) и задачи плотного предсказания, такие как детекция объектов (58.7 box AP и 51.1 mask AP на COCO test-dev) и семантическая сегментация (53.5 mIoU на ADE20K val). Его производительность значительно превосходит предыдущий state-of-the-art: +2.7 box AP и +2.6 mask AP на COCO, а также +3.2 mIoU на ADE20K, демонстрируя потенциал моделей на основе трансформеров в роли бэкендов для зрения. Иерархическая структура и подход со сдвинутыми окнами также оказываются полезны для архитектур «все-MLP». Код и модели доступны публично по адресу https://github.com/microsoft/Swin-Transformer.
Key Findings
1
Для детекции объектов и сегментации экземпляров на COCO Swin достигает 58.7 box AP и 51.1 mask AP на test-dev.
2
Для семантической сегментации на ADE20K val Swin достигает 53.5 mIoU.
3
Схема сдвинутых окон ограничивает самовнимание неперекрывающимися локальными окнами для эффективности и обеспечивает связи между окнами.
4
Swin Transformer достигает 87.3% точности top-1 на ImageNet-1K для классификации изображений.
5
Swin Transformer — иерархическая архитектура визуального Transformer с использованием сдвинутых окон для вычисления представлений.
6
Swin превосходит предыдущее состояние искусства на +2.7 box AP и +2.6 mask AP на COCO, а также на +3.2 mIoU на ADE20K.
7
Архитектура иерархична, моделирует несколько масштабов и имеет линейную вычислительную сложность по размеру изображения.
8
Иерархический дизайн и подход со сдвинутыми окнами также полезны для all-MLP архитектур.
Research Object
Swin Transformer (иерархический визуальный трансформер в качестве бэкбона с использованием сдвинутых окон)
Research Subject
Проектирование и оценка иерархической архитектуры самовнимания со сдвинутыми окнами для визуальных бэкбонов с акцентом на эффективность, многомасштабное представление, линейную сложность по размеру изображения и результаты на задачах классификации изображений, детекции объектов и семантической сегментации
Publication Details
Publication Date
2021-10-01
Journal
Publisher
ISSN
Cited by
32667
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai16
Использование генеративного искусственного интеллекта для масштабирования интеллектуальных обучающих систем2023
Pyramid Vision Transformer: универсальный бэкоун для плотного предсказания без свёрток2021
Переосмысление семантической сегментации с точки зрения sequence-to-sequence на основе трансформеров2021
Tokens-to-Token ViT: обучение визуальных трансформеров с нуля на ImageNet2021
Transformer in Transformer2021
Изображение стоит 16×16 слов: трансформеры для распознавания изображений в масштабе2020
Исследование пределов переносного обучения с унифицированным трансформером «текст-в-текст»2019
Нелокальные нейронные сети2018
mixup: За пределами эмпирической минимизации риска2017
Агрегированные остаточные преобразования для глубоких нейронных сетей2017
Классификация ImageNet с использованием глубоких сверточных нейронных сетей2017
Глубокое остаточное обучение для распознавания изображений2016
Adam: метод стохастической оптимизации2014
Очень глубокие сверточные сети для масштабного распознавания изображений2014
ImageNet: крупномасштабная иерархическая база изображений2009
Градиентное обучение для распознавания документов1998
Работы, цитирующие эту статью20
SwinIR: восстановление изображений с использованием Swin Transformer2021
Restormer: эффективный Transformer для восстановления изображений высокого разрешения2022
SegFormer: простая и эффективная архитектура для семантической сегментации с использованием трансформеров2021
UNETR: Трансформеры для 3D сегментации медицинских изображений2022
Эффективны ли трансформеры для прогнозирования временных рядов?2023
Механизмы внимания в компьютерном зрении: обзор2022
Swin Transformer V2: увеличение ёмкости и разрешения2022
PVT v2: Улучшённые базовые модели с Pyramid Vision Transformer2022
Беги, не иди: в поисках более высокой FLOPS для более быстрых нейронных сетей2023
Uformer: Общая U-образная трансформерная архитектура для восстановления изображений2022
TPH-YOLOv5: Улучшенный YOLOv5 с трансформерной головой предсказания для обнаружения объектов на снимках с дронов2021
Video Swin Transformer2022
CSWin Transformer: универсальный визуальный трансформер с перекрёстными окнами2022
Vision Transformers для удаления тумана с одиночного изображения2023
Эффективные трансформеры: обзор2022
Мультимодальное обучение с трансформерами: обзор2023
Vision Transformer с деформируемым вниманием2022
CMT: сверточные нейронные сети встречаются с визуальными трансформерами2022
Трансформеры в анализе медицинских изображений2022
DA-TransUNet: интеграция пространственного и канального двойного внимания с Transformer U-Net для сегментации медицинских изображений2024