CrossViT: мультишкальный визуальный трансформер с перекрёстным вниманием для классификации изображений

CrossViT: Cross-Attention Multi-Scale Vision Transformer for Image Classification
Rameswar Panda, Chun-Fu Richard Chen, Quanfu Fan
2021-10-01

CrossViTImageNet1Kслияние токенов через cross-attentionдвухветвевой трансформермногошкальный визион-трансформер
Недавно разработанный визуальный трансформер (ViT) показал многообещающие результаты в задаче классификации изображений по сравнению со сверточными нейронными сетями. Вдохновлённые этим, в данной работе мы изучаем, как обучать многомасштабные представления признаков в моделях трансформера для классификации изображений. Для этого мы предлагаем двухветвевый трансформер, который объединяет фрагменты изображения (т.е. токены в трансформере) разного размера для получения более сильных признаков изображения. Наш подход обрабатывает токены мелких и крупных патчей двумя отдельными ветвями с разной вычислительной сложностью, после чего эти токены несколько раз сливаются исключительно посредством механизма внимания, дополняя друг друга. Кроме того, для сокращения вычислений мы разрабатываем простой, но эффективный модуль слияния токенов на основе перекрёстного внимания, который использует один токен для каждой ветви в роли запроса для обмена информацией с другими ветвями. Предложенное перекрёстное внимание требует линейного времени как по вычислительной, так и по памяти сложности вместо квадратичной в противном случае. Широкий набор экспериментов показывает, что наш подход превосходит или сопоставим с несколькими современными работами по визуальным трансформерам, а также эффективными моделями CNN. Например, на наборе данных ImageNet1K при некоторых архитектурных изменениях наш подход опережает недавний DeiT на значительную величину в 2% при небольшом или умеренном увеличении FLOPs и числа параметров модели. Наши исходные коды и модели доступны по адресу https://github.com/IBM/CrossViT.
1
Ветви несколько раз объединяются исключительно с помощью внимания, что позволяет токенам разных размеров дополнять друг друга.
2
Широкие эксперименты показывают, что CrossViT сопоставим или превосходит несколько современных работ по трансформерам для зрения и эффективные CNN-модели.
3
Введён модуль слияния токенов на основе кросс-внимания с использованием одного токена на ветвь в качестве запроса, что снижает вычисления.
4
На ImageNet1K, с архитектурными изменениями CrossViT превосходит DeiT примерно на 2% по точности с незначительным–умеренным увеличением FLOPs и параметров.
5
Предложен CrossViT: двухветвевой трансформер, который отдельно обрабатывает токены мелких и крупных патчей для обучения многоуровневых признаков изображения.
6
Кросс-внимание требует линейного времени как по вычислительной, так и по памяти сложности вместо квадратичной.

Модель CrossViT — двухветвевой мультимасштабный визуальный трансформер для классификации изображений

Обучение и слияние мультимасштабных признаковых представлений (токены малых и больших патчей) через кросс-аттенцию для улучшения качества и эффективности классификации изображений (линейная по времени и памяти кросс-аттенция)

Publication Details
Publication Date
2021-10-01
Journal
Publisher
ISSN
Cited by
2053
Access Type
Author Information
Authors
Rameswar Panda
Chun-Fu Richard Chen
Quanfu Fan
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%