Pyramid Vision Transformer: универсальный бэкоун для плотного предсказания без свёрток

Pyramid Vision Transformer: A Versatile Backbone for Dense Prediction without Convolutions
Wenhai Wang, Enze Xie, Xiang Li, Deng-Ping Fan, Kaitao Song, Ding Liang, Tong Lü, Ping Luo, Ling Shao
2021-10-01

PVTPyramid Vision TransformerVision Transformerбесконволюционная архитектураплотные предсказания
Хотя свёрточные нейронные сети (CNN) добились значительных успехов в компьютерном зрении, в этой работе исследуется более простая архитектура бэкоуна без свёрток, пригодная для многих задач плотного предсказания. В отличие от недавно предложенного Vision Transformer (ViT), который был разработан специально для классификации изображений, мы представляем Pyramid Vision Transformer (PVT), преодолевающий трудности переноса трансформеров на различные задачи плотного предсказания. PVT имеет несколько преимуществ по сравнению с современными решениями. (1) В отличие от ViT, который обычно даёт низкое разрешение выходных карт и требует больших вычислительных и памятьных затрат, PVT можно обучать на плотных разбиениях изображения для достижения высокого разрешения выходов, что важно для задач плотного предсказания, а также он использует прогрессивную сжимающую пирамиду для уменьшения вычислений на больших картах признаков. (2) PVT наследует преимущества как CNN, так и трансформеров, что делает его унифицированным бэкоуном для различных задач зрения без свёрток, где он может выступать в качестве прямой замены CNN-бэкоунов. (3) Мы валидируем PVT с помощью обширных экспериментов, показывая, что он повышает производительность множества downstream-задач, включая детекцию объектов, instance- и семантическую сегментацию. Например, при сопоставимом числе параметров PVT+RetinaNet достигает 40.4 AP на датасете COCO, превзойдя ResNet50+RetinaNet (36.3 AP) на 4.1 абсолютных AP. Мы надеемся, что PVT сможет служить альтернативным и полезным бэкоуном для пиксельных предсказаний и способствовать дальнейшим исследованиям.
1
PVT объединяет преимущества CNN и Transformer и может служить прямой заменой CNN-бэкбонов для различных задач компьютерного зрения.
2
PVT применяет прогрессивную пирамиду ужимания для уменьшения вычислений и памяти при обработке больших карт признаков.
3
PVT улучшает качество в прикладных задачах: PVT+RetinaNet достигает 40.4 AP на COCO против 36.3 AP у ResNet50+RetinaNet, прирост 4.1 AP.
4
PVT использует обучение на плотных разбиениях изображения для получения высокоразрешённых выходов, важных для плотного предсказания.
5
Pyramid Vision Transformer (PVT) — безсверточный бэкбон, специально разработанный для задач плотного предсказания.

Бэкбон-сеть Pyramid Vision Transformer (PVT) для задач плотного предсказания

Проектирование и оценка безсверточного пирамидального Transformer-бэкбона, обеспечивающего высокое разрешение выходов при сниженных вычислениях и памяти, и его эффективность в качестве унифицированной замены CNN-бэкбонов для задач плотного предсказания (обнаружение объектов, инстанс- и семантическая сегментация)

Publication Details
Publication Date
2021-10-01
Journal
Publisher
ISSN
Cited by
4918
Access Type
Author Information
Authors
Wenhai Wang
Enze Xie
Xiang Li
Deng-Ping Fan
Kaitao Song
Ding Liang
Tong Lü
Ping Luo
Ling Shao
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%