CrossViT: мультишкальный визуальный трансформер с перекрёстным вниманием для классификации изображений
CrossViT: Cross-Attention Multi-Scale Vision Transformer for Image Classification
2021-10-01
SCID: 54.1/cbk5uc86
Discuss with AI
CrossViTImageNet1Kслияние токенов через cross-attentionдвухветвевой трансформермногошкальный визион-трансформер
Figures from the paper
Abstract (AI)
Недавно разработанный визуальный трансформер (ViT) показал многообещающие результаты в задаче классификации изображений по сравнению со сверточными нейронными сетями. Вдохновлённые этим, в данной работе мы изучаем, как обучать многомасштабные представления признаков в моделях трансформера для классификации изображений. Для этого мы предлагаем двухветвевый трансформер, который объединяет фрагменты изображения (т.е. токены в трансформере) разного размера для получения более сильных признаков изображения. Наш подход обрабатывает токены мелких и крупных патчей двумя отдельными ветвями с разной вычислительной сложностью, после чего эти токены несколько раз сливаются исключительно посредством механизма внимания, дополняя друг друга. Кроме того, для сокращения вычислений мы разрабатываем простой, но эффективный модуль слияния токенов на основе перекрёстного внимания, который использует один токен для каждой ветви в роли запроса для обмена информацией с другими ветвями. Предложенное перекрёстное внимание требует линейного времени как по вычислительной, так и по памяти сложности вместо квадратичной в противном случае. Широкий набор экспериментов показывает, что наш подход превосходит или сопоставим с несколькими современными работами по визуальным трансформерам, а также эффективными моделями CNN. Например, на наборе данных ImageNet1K при некоторых архитектурных изменениях наш подход опережает недавний DeiT на значительную величину в 2% при небольшом или умеренном увеличении FLOPs и числа параметров модели. Наши исходные коды и модели доступны по адресу https://github.com/IBM/CrossViT.
Key Findings
1
Ветви несколько раз объединяются исключительно с помощью внимания, что позволяет токенам разных размеров дополнять друг друга.
2
Широкие эксперименты показывают, что CrossViT сопоставим или превосходит несколько современных работ по трансформерам для зрения и эффективные CNN-модели.
3
Введён модуль слияния токенов на основе кросс-внимания с использованием одного токена на ветвь в качестве запроса, что снижает вычисления.
4
На ImageNet1K, с архитектурными изменениями CrossViT превосходит DeiT примерно на 2% по точности с незначительным–умеренным увеличением FLOPs и параметров.
5
Предложен CrossViT: двухветвевой трансформер, который отдельно обрабатывает токены мелких и крупных патчей для обучения многоуровневых признаков изображения.
6
Кросс-внимание требует линейного времени как по вычислительной, так и по памяти сложности вместо квадратичной.
Research Object
Модель CrossViT — двухветвевой мультимасштабный визуальный трансформер для классификации изображений
Research Subject
Обучение и слияние мультимасштабных признаковых представлений (токены малых и больших патчей) через кросс-аттенцию для улучшения качества и эффективности классификации изображений (линейная по времени и памяти кросс-аттенция)
Publication Details
Publication Date
2021-10-01
Journal
Publisher
ISSN
Cited by
2053
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai6
Использование генеративного искусственного интеллекта для масштабирования интеллектуальных обучающих систем2023
Обучение нескольких слоев признаков на маленьких изображениях2024
Pyramid Vision Transformer: универсальный бэкоун для плотного предсказания без свёрток2021
Tokens-to-Token ViT: обучение визуальных трансформеров с нуля на ImageNet2021
Изображение стоит 16×16 слов: трансформеры для распознавания изображений в масштабе2020
Нелокальные нейронные сети2018