CSWin Transformer: универсальный визион-трансформерный бэкенд с поперечно-образными окнами

CSWin Transformer: A General Vision Transformer Backbone with Cross-Shaped Windows
Jianmin Bao, Baining Guo, Nenghai Yu, Dongdong Chen, Xiaoyi Dong, Weiming Zhang, Lu Yuan, Dong Chen
2022-06-01

COCO detection / ADE20K segmentationCSWin Transformerсквозное внимание с крестообразными окнами (Cross-Shaped Window)ImageNet-1K / ImageNet-21Kлокально-усилённое позиционное кодирование (LePE)
Мы представляем CSWin Transformer — эффективный и действенный бэкенд на базе Transformer для задач общего назначения в области компьютерного зрения. Одна из сложных проблем при разработке Transformer состоит в том, что глобальное самовнимание очень дорого по вычислениям, тогда как локальное самовнимание часто ограничивает поле взаимодействий каждого токена. Для решения этой проблемы мы разработали механизм самовнимания с поперечно-образным окном (Cross-Shaped Window), который вычисляет самовнимание параллельно по горизонтальным и вертикальным полосам, образующим поперечно-образное окно; каждая полоса получается разбиением входного признакового представления на полосы равной ширины. Мы приводим математический анализ влияния ширины полос и варьируем ширину полос для разных слоев сети Transformer, что обеспечивает высокую моделирующую способность при ограничении вычислительных затрат. Мы также вводим локально-улучшенное позиционное кодирование (Locally-enhanced Positional Encoding, LePE), которое лучше учитывает локальную позиционную информацию по сравнению с существующими схемами кодирования. LePE естественно поддерживает произвольные входные разрешения, что делает его особенно эффективным и удобным для downstream-задач. В сочетании с этими решениями и иерархической структурой CSWin Transformer демонстрирует конкурентную производительность на типичных задачах компьютерного зрения. В частности, он достигает 85.4% Top-1 точности на ImageNet-1K без дополнительного обучающего набора или меток, 53.9 box AP и 46.4 mask AP в задаче детекции COCO и 52.2 mIoU в задаче семантической сегментации ADE20K, превосходя предыдущий передовой бэкенд Swin Transformer на +1.2, +2.0, +1.4 и +2.0 соответственно при сходных FLOPs. При дополнительном предварительном обучении на большем наборе ImageNet-21K мы достигаем 87.5% Top-1 точности на ImageNet-1K и высокой сегментационной производительности на ADE20K с 55.7 mIoU. Код и предобученная модель доступны по адресу https://github.com/microsoft/CSWin-Transformer
1
CSWin Transformer с иерархической структурой достигает 85.4% Top-1 на ImageNet-1K без дополнительных данных, превосходя Swin Transformer на +1.2 при схожих FLOPs.
2
CSWin достигает 53.9 box AP и 46.4 mask AP на COCO detection, а также 52.2 mIoU на ADE20K сегментации, улучшая показатели Swin на +2.0, +1.4 и +2.0 соответственно при схожих FLOPs.
3
Введён механизм сквозного внимания Cross-Shaped Window (CSWin), вычисляющий self-attention параллельно по горизонтальным и вертикальным полосам, образующим крестообразные окна.
4
Предобучение на ImageNet-21K даёт 87.5% Top-1 на ImageNet-1K и повышает сегментацию на ADE20K до 55.7 mIoU.
5
Предложена локально-усиленная позиционная кодировка (LePE), которая лучше учитывает локальную позиционную информацию и естественно поддерживает произвольные разрешения входа.
6
Изменение ширины полос на разных слоях трансформера обеспечивает сильные моделирующие способности при ограниченных вычислительных затратах, что подтверждается математическим анализом.

Backbone CSWin Transformer (архитектура vision Transformer с механизмом самовнимания Cross-Shaped Window и локально усовершенствованным позиционным кодированием)

Проектирование и оценка самовнимания с поперечно-осевыми окнами, назначения ширины полос на разных слоях и локально усовершенствованного позиционного кодирования для повышения способности моделирования, вычислительной эффективности и качества на задачах компьютерного зрения

Publication Details
Publication Date
2022-06-01
Journal
Publisher
ISSN
Cited by
1310
Access Type
Author Information
Authors
Jianmin Bao
Baining Guo
Nenghai Yu
Dongdong Chen
Xiaoyi Dong
Weiming Zhang
Lu Yuan
Dong Chen
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%