PVT v2: Улучшённые базовые модели с Pyramid Vision Transformer
PVT v2: Improved baselines with pyramid vision transformer
2022-03-16
SCID: 54.1/4fmjckqw
Discuss with AI
PVT v2Pyramid Vision Transformerсверточная сеть прямого распространения (convolutional feed-forward network)линейно-сложный механизм вниманияперекрывающаяся патч-эмбеддинг (overlapping patch embedding)
Figures from the paper
Abstract (AI)
Трансформеры в последнее время показали обнадёживающий прогресс в компьютерном зрении. В этой работе мы представляем новые базовые модели, улучшив оригинальный Pyramid Vision Transformer (PVT v1) за счёт трёх решений: (i) слоя внимания с линейной вычислительной сложностью, (ii) перекрывающейся эмбеддинга патчей и (iii) сверточной сети прямого распространения (convolutional feed-forward network). С этими модификациями PVT v2 уменьшает вычислительную сложность PVT v1 до линейной и обеспечивает существенные улучшения в фундаментальных задачах зрения, таких как классификация, детекция и сегментация. В частности, PVT v2 достигает сопоставимой или более высокой производительности по сравнению с недавними работами, такими как Swin Transformer. Мы надеемся, что эта работа содействует исследованиям передовых трансформеров в области компьютерного зрения. Исходный код доступен по адресу https://github.com/whai362/PVT.
Key Findings
1
PVT v2 достигает сравнимой или лучшей производительности по сравнению с современными трансформерами, такими как Swin transformer.
2
PVT v2 вводит три изменения в архитектуру: слой внимания с линейной сложностью, перекрывающееся разбиение на патчи и сверточную сеть feed-forward.
3
PVT v2 обеспечивает значительные улучшения в задачах классификации, детекции и сегментации.
4
Авторы публикуют код PVT v2 для облегчения дальнейших исследований трансформеров в компьютерном зрении.
5
Внимание с линейной сложностью снижает вычислительную сложность PVT v1 до линейной.
Research Object
Архитектура Pyramid Vision Transformer (PVT) (PVT v2)
Research Subject
Архитектурные улучшения и их влияние на вычислительную сложность и качество на задачах компьютерного зрения — в частности внимание с линейной сложностью, перекрывающаяся патчевая эмбеддинг и сверточная feed-forward сеть, приводящие к линейной сложности и улучшению результатов в классификации, детекции и сегментации
Publication Details
Publication Date
2022-03-16
Journal
Publisher
ISSN
Cited by
2368
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai13
Использование генеративного искусственного интеллекта для масштабирования интеллектуальных обучающих систем2023
Swin Transformer: Иерархический визуальный трансформер с использова́нием сдвинутых окон2021
Pyramid Vision Transformer: универсальный бэкоун для плотного предсказания без свёрток2021
Tokens-to-Token ViT: обучение визуальных трансформеров с нуля на ImageNet2021
CrossViT: мультишкальный визуальный трансформер с перекрёстным вниманием для классификации изображений2021
Transformer in Transformer2021
Изображение стоит 16×16 слов: трансформеры для распознавания изображений в масштабе2020
mixup: За пределами эмпирической минимизации риска2017
Агрегированные остаточные преобразования для глубоких нейронных сетей2017
Глубокое остаточное обучение для распознавания изображений2016
Переосмысление архитектуры Inception для компьютерного зрения2016
ImageNet: крупномасштабная иерархическая база изображений2009
Труды 24-й Международной конференции по машинному обучению2007