Swin Transformer V2: увеличение ёмкости и разрешения

Swin Transformer V2: Scaling Up Capacity and Resolution
Zhuliang Yao, Yue Cao, Zheng Zhang, Han Hu, Furu Wei, Zhenda Xie, Baining Guo, Ze Liu, Yutong Lin, Yixuan Wei, Li Dong, Ning Jia
2022-06-01

Swin Transformer V2обучение с высоким разрешением (1536x1536)логарифмически распределённый непрерывный позиционный бейспамятеефективная реализацияостаточная пост-нормализациямасштабированное косинусное вниманиемасштабирование ёмкостисамообучение (self-supervised pre-training)передовые результаты на ImageNet-V2 COCO ADE20K Kinetics-400перенос с низкого на высокое разрешение
Мы представляем методы масштабирования Swin Transformer до 3 миллиардов параметров и обеспечения обучения с изображениями разрешением до 1 536×1 536. За счёт увеличения ёмкости и разрешения Swin Transformer устанавливает новые рекорды на четырёх репрезентативных визуальных бенчмарках: 84,0% top-1 на классификации изображений ImageNet‑V2, 63,1 / 54,4 box / mask mAP на задачах детекции объектов COCO, 59,9 mIoU на семантической сегментации ADE20K и 86,8% top-1 на классификации видеодействий Kinetics-400. Мы решаем проблемы нестабильности обучения и исследуем, как эффективно переносить модели, предварительно обученные при низком разрешении, на модели с более высоким разрешением. С этой целью предложены несколько новых технологий: (1) техника остаточной пост-нормализации и подход со шкалированным косинусным вниманием для повышения стабильности больших визуальных моделей; (2) техника логарифмически расположенного непрерывного позиционного смещения для эффективного переноса моделей, предварительно обученных на изображениях и окнах низкого разрешения, на соответствующие высокоразрешённые варианты. Кроме того, мы делимся важными деталями реализации, которые обеспечивают значительную экономию памяти GPU и делают возможным обучение больших визуальных моделей на обычных GPU. С использованием этих методов и самоконтролируемого предобучения мы успешно обучаем сильную модель Swin Transformer с 3 миллиардами параметров и эффективно переносим её на различные визуальные задачи с изображениями или окнами высокого разрешения, добиваясь передовых точностей на множестве бенчмарков. Код доступен по адресу https://github.com/microsoft/Swin-Transformer.
1
Показано, что самонеподконтрольное (self-supervised) предобучение в сочетании с предложенными приемами позволяет эффективно переносить 3B Swin Transformer на задачи с высоким разрешением и достигать передовых результатов.
2
Предложены методы масштабирования Swin Transformer до 3 миллиардов параметров и обучения с изображениями до разрешения 1536x1536.
3
Предложен log-spaced continuous position bias для эффективного переноса моделей, предобученных при низком разрешении и размерах окон, на более высокие разрешения.
4
Предложены residual post normalization и scaled cosine attention для повышения стабильности обучения больших моделей зрения.
5
Предоставлены детали реализации, существенно снижающие потребление GPU-памяти и позволяющие обучать большие модели зрения на обычных GPU.
6
Установлены новые рекорды на бенчмарках: 84.0% top-1 на ImageNet-V2, 63.1/54.4 box/mask mAP на COCO, 59.9 mIoU на ADE20K, 86.8% top-1 на Kinetics-400.

Модель(и) визуального трансформера Swin Transformer V2 в крупном масштабе (до 3 миллиардов параметров), обученные для задач с высокоразрешёнными изображениями и видео

Методы и особенности масштабирования ёмкости и разрешения, включая стабильность обучения (residual post normalization, scaled cosine attention), перенос с низкого на высокое разрешение через логарифмически распределённый непрерывный позиционный bias, реализации, экономящие память GPU, и их влияние на результаты на визуальных бенчмарках

Publication Details
Publication Date
2022-06-01
Journal
Publisher
ISSN
Cited by
2389
Access Type
Author Information
Authors
Zhuliang Yao
Yue Cao
Zheng Zhang
Han Hu
Furu Wei
Zhenda Xie
Baining Guo
Ze Liu
Yutong Lin
Yixuan Wei
Li Dong
Ning Jia
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%