Swin Transformer: Иерархический визуальный трансформер с использова́нием сдвинутых окон

Swin Transformer: Hierarchical Vision Transformer using Shifted Windows
Yue Cao, Zheng Zhang, Stephen Lin, Han Hu, Baining Guo, Ze Liu, Yutong Lin, Yixuan Wei
2021-10-01

иерархический трансформерсдвинутые окнаSwin Transformerклассификация изображений (ImageNet-1K)детекция объектов и сегментация инстансов (COCO)
В статье представлен новый визуальный трансформер под названием Swin Transformer, который служит универсальным базовым модулем для задач компьютерного зрения. Адаптация трансформера из области языка к области зрения осложняется различиями между этими доменами, такими как большие вариации в масштабе визуальных объектов и более высокое разрешение пикселей в изображениях по сравнению со словами в тексте. Для учета этих различий мы предлагаем иерархический трансформер, представления в котором вычисляются с использованием сдвинутых окон. Схема со сдвинутыми окнами повышает эффективность за счет ограничения вычислений self-attention неперекрывающимися локальными окнами при одновременном обеспечении связей между окнами. Эта иерархическая архитектура обладает гибкостью моделирования на различных масштабах и имеет линейную вычислительную сложность относительно размера изображения. Эти свойства Swin Transformer делают его совместимым с широким спектром задач зрения, включая классификацию изображений (87.3% top-1 на ImageNet-1K) и задачи плотного предсказания, такие как детекция объектов (58.7 box AP и 51.1 mask AP на COCO test-dev) и семантическая сегментация (53.5 mIoU на ADE20K val). Его производительность значительно превосходит предыдущий state-of-the-art: +2.7 box AP и +2.6 mask AP на COCO, а также +3.2 mIoU на ADE20K, демонстрируя потенциал моделей на основе трансформеров в роли бэкендов для зрения. Иерархическая структура и подход со сдвинутыми окнами также оказываются полезны для архитектур «все-MLP». Код и модели доступны публично по адресу https://github.com/microsoft/Swin-Transformer.
1
Для детекции объектов и сегментации экземпляров на COCO Swin достигает 58.7 box AP и 51.1 mask AP на test-dev.
2
Для семантической сегментации на ADE20K val Swin достигает 53.5 mIoU.
3
Схема сдвинутых окон ограничивает самовнимание неперекрывающимися локальными окнами для эффективности и обеспечивает связи между окнами.
4
Swin Transformer достигает 87.3% точности top-1 на ImageNet-1K для классификации изображений.
5
Swin Transformer — иерархическая архитектура визуального Transformer с использованием сдвинутых окон для вычисления представлений.
6
Swin превосходит предыдущее состояние искусства на +2.7 box AP и +2.6 mask AP на COCO, а также на +3.2 mIoU на ADE20K.
7
Архитектура иерархична, моделирует несколько масштабов и имеет линейную вычислительную сложность по размеру изображения.
8
Иерархический дизайн и подход со сдвинутыми окнами также полезны для all-MLP архитектур.

Swin Transformer (иерархический визуальный трансформер в качестве бэкбона с использованием сдвинутых окон)

Проектирование и оценка иерархической архитектуры самовнимания со сдвинутыми окнами для визуальных бэкбонов с акцентом на эффективность, многомасштабное представление, линейную сложность по размеру изображения и результаты на задачах классификации изображений, детекции объектов и семантической сегментации

Publication Details
Publication Date
2021-10-01
Journal
Publisher
ISSN
Cited by
32667
Access Type
Author Information
Authors
Yue Cao
Zheng Zhang
Stephen Lin
Han Hu
Baining Guo
Ze Liu
Yutong Lin
Yixuan Wei
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%