Vision Transformer с деформируемым вниманием
Vision Transformer with Deformable Attention
2022-06-01
SCID: 54.1/8768wtv2
Discuss with AI
Deformable Attention Transformerдеформируемое самовниманиеплотная предсказательная задачаразреженное вниманиевизуальный трансформер
Figures from the paper
Abstract (AI)
Трансформеры недавно продемонстрировали превосходные результаты в различных задачах компьютерного зрения. Большое, иногда даже глобальное, рецептивное поле наделяет модели Transformer большей представительной мощностью по сравнению с их сверточными аналогами. Тем не менее простое увеличение рецептивного поля вызывает ряд проблем. С одной стороны, использование плотного внимания (например, в ViT) приводит к чрезмерным затратам памяти и вычислений, и признаки могут подвергаться влиянию нерелевантных частей, выходящих за пределы областей интереса. С другой стороны, разреженное внимание, применяемое в PVT или Swin Transformer, не зависит от данных и может ограничивать способность моделировать дальние взаимосвязи. Чтобы смягчить эти проблемы, мы предлагаем новый модуль деформируемого самовнимания, в котором позиции пар ключей и значений в самовнимании выбираются зависимым от данных образом. Эта гибкая схема позволяет модулю самовнимания концентрироваться на релевантных областях и извлекать более информативные признаки. На этой основе мы представляем Deformable Attention Transformer — универсальную базовую модель с деформируемым вниманием для задач классификации изображений и плотного предсказания. Обширные эксперименты показывают, что наши модели последовательно демонстрируют улучшенные результаты на комплексных бенчмарках. Код доступен по адресу https://github.com/LeapLabTHU/DAT.
Key Findings
1
DAT решает проблемы плотного внимания (большие затраты памяти/вычислений, влияние нерелевантных областей) и разреженного внимание-агностичного к данным (ограниченное моделирование дальнодействующих связей).
2
Деформируемое внимание позволяет модулю самовнимания фокусироваться на релевантных областях и захватывать более информативные признаки.
3
Обширные эксперименты показывают, что модели DAT последовательно демонстрируют улучшенные результаты на комплексных бенчмарках.
4
Представлен Deformable Attention Transformer (DAT) как общая бэкон-архитектура для классификации изображений и задач плотного предсказания.
5
Предложен модуль деформируемого самовнимания, который выбирает позиции ключей и значений в зависимости от данных.
Research Object
Модель Vision Transformer, дополненная модулем деформируемого самовнимания (базовая сеть Deformable Attention Transformer)
Research Subject
Проектирование и оценка деформируемого (зависящего от данных) механизма самовнимания для выбора позиций ключей/значений с целью снижения вычислительных затрат и фокусировки на релевантных областях для улучшения представлений и результатов в задачах классификации изображений и плотного предсказания
Publication Details
Publication Date
2022-06-01
Journal
Publisher
ISSN
Cited by
940
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai7
Использование генеративного искусственного интеллекта для масштабирования интеллектуальных обучающих систем2023
Swin Transformer: Иерархический визуальный трансформер с использова́нием сдвинутых окон2021
Pyramid Vision Transformer: универсальный бэкоун для плотного предсказания без свёрток2021
PVT v2: Улучшённые базовые модели с Pyramid Vision Transformer2022
CSWin Transformer: универсальный визуальный трансформер с перекрёстными окнами2022
CMT: сверточные нейронные сети встречаются с визуальными трансформерами2022
Изображение стоит 16×16 слов: трансформеры для распознавания изображений в масштабе2020