Pyramid Vision Transformer: универсальный бэкоун для плотного предсказания без свёрток
Pyramid Vision Transformer: A Versatile Backbone for Dense Prediction without Convolutions
2021-10-01
SCID: 54.1/8v636w28
Discuss with AI
PVTPyramid Vision TransformerVision Transformerбесконволюционная архитектураплотные предсказания
Figures from the paper
Abstract (AI)
Хотя свёрточные нейронные сети (CNN) добились значительных успехов в компьютерном зрении, в этой работе исследуется более простая архитектура бэкоуна без свёрток, пригодная для многих задач плотного предсказания. В отличие от недавно предложенного Vision Transformer (ViT), который был разработан специально для классификации изображений, мы представляем Pyramid Vision Transformer (PVT), преодолевающий трудности переноса трансформеров на различные задачи плотного предсказания. PVT имеет несколько преимуществ по сравнению с современными решениями. (1) В отличие от ViT, который обычно даёт низкое разрешение выходных карт и требует больших вычислительных и памятьных затрат, PVT можно обучать на плотных разбиениях изображения для достижения высокого разрешения выходов, что важно для задач плотного предсказания, а также он использует прогрессивную сжимающую пирамиду для уменьшения вычислений на больших картах признаков. (2) PVT наследует преимущества как CNN, так и трансформеров, что делает его унифицированным бэкоуном для различных задач зрения без свёрток, где он может выступать в качестве прямой замены CNN-бэкоунов. (3) Мы валидируем PVT с помощью обширных экспериментов, показывая, что он повышает производительность множества downstream-задач, включая детекцию объектов, instance- и семантическую сегментацию. Например, при сопоставимом числе параметров PVT+RetinaNet достигает 40.4 AP на датасете COCO, превзойдя ResNet50+RetinaNet (36.3 AP) на 4.1 абсолютных AP. Мы надеемся, что PVT сможет служить альтернативным и полезным бэкоуном для пиксельных предсказаний и способствовать дальнейшим исследованиям.
Key Findings
1
PVT объединяет преимущества CNN и Transformer и может служить прямой заменой CNN-бэкбонов для различных задач компьютерного зрения.
2
PVT применяет прогрессивную пирамиду ужимания для уменьшения вычислений и памяти при обработке больших карт признаков.
3
PVT улучшает качество в прикладных задачах: PVT+RetinaNet достигает 40.4 AP на COCO против 36.3 AP у ResNet50+RetinaNet, прирост 4.1 AP.
4
PVT использует обучение на плотных разбиениях изображения для получения высокоразрешённых выходов, важных для плотного предсказания.
5
Pyramid Vision Transformer (PVT) — безсверточный бэкбон, специально разработанный для задач плотного предсказания.
Research Object
Бэкбон-сеть Pyramid Vision Transformer (PVT) для задач плотного предсказания
Research Subject
Проектирование и оценка безсверточного пирамидального Transformer-бэкбона, обеспечивающего высокое разрешение выходов при сниженных вычислениях и памяти, и его эффективность в качестве унифицированной замены CNN-бэкбонов для задач плотного предсказания (обнаружение объектов, инстанс- и семантическая сегментация)
Publication Details
Publication Date
2021-10-01
Journal
Publisher
ISSN
Cited by
4918
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai16
Использование генеративного искусственного интеллекта для масштабирования интеллектуальных обучающих систем2023
PVT v2: Улучшённые базовые модели с Pyramid Vision Transformer2022
Tokens-to-Token ViT: обучение визуальных трансформеров с нуля на ImageNet2021
Transformer in Transformer2021
Изображение стоит 16×16 слов: трансформеры для распознавания изображений в масштабе2020
Обзор методов аугментации изображений для глубокого обучения2019
Нелокальные нейронные сети2018
Сети Squeeze-and-Excitation2018
mixup: За пределами эмпирической минимизации риска2017
Агрегированные остаточные преобразования для глубоких нейронных сетей2017
Классификация ImageNet с использованием глубоких сверточных нейронных сетей2017
Глубокое остаточное обучение для распознавания изображений2016
Переосмысление архитектуры Inception для компьютерного зрения2016
Очень глубокие сверточные сети для масштабного распознавания изображений2014
ImageNet: крупномасштабная иерархическая база изображений2009
Градиентное обучение для распознавания документов1998
Работы, цитирующие эту статью16
Swin Transformer: Иерархический визуальный трансформер с использова́нием сдвинутых окон2021
Restormer: эффективный Transformer для восстановления изображений высокого разрешения2022
SegFormer: простая и эффективная архитектура для семантической сегментации с использованием трансформеров2021
UNETR: Трансформеры для 3D сегментации медицинских изображений2022
Механизмы внимания в компьютерном зрении: обзор2022
Swin Transformer V2: увеличение ёмкости и разрешения2022
PVT v2: Улучшённые базовые модели с Pyramid Vision Transformer2022
Беги, не иди: в поисках более высокой FLOPS для более быстрых нейронных сетей2023
Uformer: Общая U-образная трансформерная архитектура для восстановления изображений2022
CrossViT: мультишкальный визуальный трансформер с перекрёстным вниманием для классификации изображений2021
CSWin Transformer: универсальный визуальный трансформер с перекрёстными окнами2022
Vision Transformers для удаления тумана с одиночного изображения2023
Vision Transformer с деформируемым вниманием2022
CMT: сверточные нейронные сети встречаются с визуальными трансформерами2022
Масштабирование Vision Transformer2022
MS-TCT: Многомасштабный временной ConvTransformer для обнаружения действий2022