Swin Transformer V2: увеличение ёмкости и разрешения
Swin Transformer V2: Scaling Up Capacity and Resolution
2022-06-01
SCID: 54.1/96hbndrf
Discuss with AI
Swin Transformer V2обучение с высоким разрешением (1536x1536)логарифмически распределённый непрерывный позиционный бейспамятеефективная реализацияостаточная пост-нормализациямасштабированное косинусное вниманиемасштабирование ёмкостисамообучение (self-supervised pre-training)передовые результаты на ImageNet-V2 COCO ADE20K Kinetics-400перенос с низкого на высокое разрешение
Figures from the paper
Abstract (AI)
Мы представляем методы масштабирования Swin Transformer до 3 миллиардов параметров и обеспечения обучения с изображениями разрешением до 1 536×1 536. За счёт увеличения ёмкости и разрешения Swin Transformer устанавливает новые рекорды на четырёх репрезентативных визуальных бенчмарках: 84,0% top-1 на классификации изображений ImageNet‑V2, 63,1 / 54,4 box / mask mAP на задачах детекции объектов COCO, 59,9 mIoU на семантической сегментации ADE20K и 86,8% top-1 на классификации видеодействий Kinetics-400. Мы решаем проблемы нестабильности обучения и исследуем, как эффективно переносить модели, предварительно обученные при низком разрешении, на модели с более высоким разрешением. С этой целью предложены несколько новых технологий: (1) техника остаточной пост-нормализации и подход со шкалированным косинусным вниманием для повышения стабильности больших визуальных моделей; (2) техника логарифмически расположенного непрерывного позиционного смещения для эффективного переноса моделей, предварительно обученных на изображениях и окнах низкого разрешения, на соответствующие высокоразрешённые варианты. Кроме того, мы делимся важными деталями реализации, которые обеспечивают значительную экономию памяти GPU и делают возможным обучение больших визуальных моделей на обычных GPU. С использованием этих методов и самоконтролируемого предобучения мы успешно обучаем сильную модель Swin Transformer с 3 миллиардами параметров и эффективно переносим её на различные визуальные задачи с изображениями или окнами высокого разрешения, добиваясь передовых точностей на множестве бенчмарков. Код доступен по адресу https://github.com/microsoft/Swin-Transformer.
Key Findings
1
Показано, что самонеподконтрольное (self-supervised) предобучение в сочетании с предложенными приемами позволяет эффективно переносить 3B Swin Transformer на задачи с высоким разрешением и достигать передовых результатов.
2
Предложены методы масштабирования Swin Transformer до 3 миллиардов параметров и обучения с изображениями до разрешения 1536x1536.
3
Предложен log-spaced continuous position bias для эффективного переноса моделей, предобученных при низком разрешении и размерах окон, на более высокие разрешения.
4
Предложены residual post normalization и scaled cosine attention для повышения стабильности обучения больших моделей зрения.
5
Предоставлены детали реализации, существенно снижающие потребление GPU-памяти и позволяющие обучать большие модели зрения на обычных GPU.
6
Установлены новые рекорды на бенчмарках: 84.0% top-1 на ImageNet-V2, 63.1/54.4 box/mask mAP на COCO, 59.9 mIoU на ADE20K, 86.8% top-1 на Kinetics-400.
Research Object
Модель(и) визуального трансформера Swin Transformer V2 в крупном масштабе (до 3 миллиардов параметров), обученные для задач с высокоразрешёнными изображениями и видео
Research Subject
Методы и особенности масштабирования ёмкости и разрешения, включая стабильность обучения (residual post normalization, scaled cosine attention), перенос с низкого на высокое разрешение через логарифмически распределённый непрерывный позиционный bias, реализации, экономящие память GPU, и их влияние на результаты на визуальных бенчмарках
Publication Details
Publication Date
2022-06-01
Journal
Publisher
ISSN
Cited by
2389
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai8
Использование генеративного искусственного интеллекта для масштабирования интеллектуальных обучающих систем2023
Swin Transformer: Иерархический визуальный трансформер с использова́нием сдвинутых окон2021
Фреймворк Aion: размерное возникновение сознания ИИ, коллапс под воздействием наблюдателя и динамика космологических порталов2023
Pyramid Vision Transformer: универсальный бэкоун для плотного предсказания без свёрток2021
Video Swin Transformer2022
CSWin Transformer: универсальный визуальный трансформер с перекрёстными окнами2022
Изображение стоит 16×16 слов: трансформеры для распознавания изображений в масштабе2020
Исследование пределов переносного обучения с унифицированным трансформером «текст-в-текст»2019