CSWin Transformer: универсальный визион-трансформерный бэкенд с поперечно-образными окнами
CSWin Transformer: A General Vision Transformer Backbone with Cross-Shaped Windows
2022-06-01
SCID: 54.1/ahfpzeht
Discuss with AI
COCO detection / ADE20K segmentationCSWin Transformerсквозное внимание с крестообразными окнами (Cross-Shaped Window)ImageNet-1K / ImageNet-21Kлокально-усилённое позиционное кодирование (LePE)
Figures from the paper
Abstract (AI)
Мы представляем CSWin Transformer — эффективный и действенный бэкенд на базе Transformer для задач общего назначения в области компьютерного зрения. Одна из сложных проблем при разработке Transformer состоит в том, что глобальное самовнимание очень дорого по вычислениям, тогда как локальное самовнимание часто ограничивает поле взаимодействий каждого токена. Для решения этой проблемы мы разработали механизм самовнимания с поперечно-образным окном (Cross-Shaped Window), который вычисляет самовнимание параллельно по горизонтальным и вертикальным полосам, образующим поперечно-образное окно; каждая полоса получается разбиением входного признакового представления на полосы равной ширины. Мы приводим математический анализ влияния ширины полос и варьируем ширину полос для разных слоев сети Transformer, что обеспечивает высокую моделирующую способность при ограничении вычислительных затрат. Мы также вводим локально-улучшенное позиционное кодирование (Locally-enhanced Positional Encoding, LePE), которое лучше учитывает локальную позиционную информацию по сравнению с существующими схемами кодирования. LePE естественно поддерживает произвольные входные разрешения, что делает его особенно эффективным и удобным для downstream-задач. В сочетании с этими решениями и иерархической структурой CSWin Transformer демонстрирует конкурентную производительность на типичных задачах компьютерного зрения. В частности, он достигает 85.4% Top-1 точности на ImageNet-1K без дополнительного обучающего набора или меток, 53.9 box AP и 46.4 mask AP в задаче детекции COCO и 52.2 mIoU в задаче семантической сегментации ADE20K, превосходя предыдущий передовой бэкенд Swin Transformer на +1.2, +2.0, +1.4 и +2.0 соответственно при сходных FLOPs. При дополнительном предварительном обучении на большем наборе ImageNet-21K мы достигаем 87.5% Top-1 точности на ImageNet-1K и высокой сегментационной производительности на ADE20K с 55.7 mIoU. Код и предобученная модель доступны по адресу https://github.com/microsoft/CSWin-Transformer
Key Findings
1
CSWin Transformer с иерархической структурой достигает 85.4% Top-1 на ImageNet-1K без дополнительных данных, превосходя Swin Transformer на +1.2 при схожих FLOPs.
2
CSWin достигает 53.9 box AP и 46.4 mask AP на COCO detection, а также 52.2 mIoU на ADE20K сегментации, улучшая показатели Swin на +2.0, +1.4 и +2.0 соответственно при схожих FLOPs.
3
Введён механизм сквозного внимания Cross-Shaped Window (CSWin), вычисляющий self-attention параллельно по горизонтальным и вертикальным полосам, образующим крестообразные окна.
4
Предобучение на ImageNet-21K даёт 87.5% Top-1 на ImageNet-1K и повышает сегментацию на ADE20K до 55.7 mIoU.
5
Предложена локально-усиленная позиционная кодировка (LePE), которая лучше учитывает локальную позиционную информацию и естественно поддерживает произвольные разрешения входа.
6
Изменение ширины полос на разных слоях трансформера обеспечивает сильные моделирующие способности при ограниченных вычислительных затратах, что подтверждается математическим анализом.
Research Object
Backbone CSWin Transformer (архитектура vision Transformer с механизмом самовнимания Cross-Shaped Window и локально усовершенствованным позиционным кодированием)
Research Subject
Проектирование и оценка самовнимания с поперечно-осевыми окнами, назначения ширины полос на разных слоях и локально усовершенствованного позиционного кодирования для повышения способности моделирования, вычислительной эффективности и качества на задачах компьютерного зрения
Publication Details
Publication Date
2022-06-01
Journal
Publisher
ISSN
Cited by
1310
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai14
Использование генеративного искусственного интеллекта для масштабирования интеллектуальных обучающих систем2023
Swin Transformer: Иерархический визуальный трансформер с использова́нием сдвинутых окон2021
Pyramid Vision Transformer: универсальный бэкоун для плотного предсказания без свёрток2021
Переосмысление семантической сегментации с точки зрения sequence-to-sequence на основе трансформеров2021
Tokens-to-Token ViT: обучение визуальных трансформеров с нуля на ImageNet2021
Предобученный трансформер для обработки изображений2021
Transformer in Transformer2021
Изображение стоит 16×16 слов: трансформеры для распознавания изображений в масштабе2020
Longformer: трансформер для длинных документов2020
Сети Squeeze-and-Excitation2018
Агрегированные остаточные преобразования для глубоких нейронных сетей2017
Глубокое остаточное обучение для распознавания изображений2016
Очень глубокие сверточные сети для масштабного распознавания изображений2014
ImageNet: крупномасштабная иерархическая база изображений2009