CMT: сверточные нейронные сети встречаются с визуальными трансформерами

CMT: Convolutional Neural Networks Meet Vision Transformers
Jianyuan Guo, Kai Han, Yunhe Wang, Xinghao Chen, Chang Xu, Yehui Tang, Han Wu
2022-06-01

ImageNetвычислительная эффективностьсверточные нейронные сетигибридная сетьвизуальные трансформеры
Визуальные трансформеры успешно применяются для решения задач распознавания изображений благодаря способности выявлять дальние зависимости внутри изображения. Однако между трансформерами и существующими сверточными нейронными сетями (CNN) по-прежнему сохраняются различия как в производительности, так и в вычислительных затратах. В этой статье мы стремимся решить эту проблему и разработать сеть, превосходящую не только классические трансформеры, но и высокопроизводительные сверточные модели. Мы предлагаем новую гибридную сеть на основе трансформера, использующую трансформеры для выявления дальних зависимостей, а CNN — для извлечения локальной информации. Кроме того, мы масштабируем ее, получая семейство моделей под названием CMT, которые обеспечивают значительно более выгодный компромисс между точностью и эффективностью по сравнению с предыдущими моделями на основе CNN и трансформеров. В частности, наша модель CMT-S достигает точности top-1 83,5% на ImageNet, используя в 14 и 2 раза меньше FLOPs, чем существующие модели DeiT и EfficientNet соответственно. Предложенная CMT-S также хорошо обобщается на CIFAR10 (99,2%), CIFAR100 (91,7%), Flowers (98,7%) и другие сложные наборы данных для компьютерного зрения, такие как COCO (44,3% mAP), при значительно меньших вычислительных затратах.
1
Модели CMT обеспечивают более выгодный компромисс между точностью и эффективностью по сравнению с предыдущими CNN- и трансформерными архитектурами.
2
CMT-S демонстрирует высокую обобщающую способность: 99,2% на CIFAR10, 91,7% на CIFAR100, 98,7% на Flowers и 44,3% mAP на COCO.
3
CMT-S достигает точности 83,5% top-1 на ImageNet, используя в 14 раз меньше FLOPs, чем DeiT, и в 2 раза меньше, чем EfficientNet.
4
Семейство CMT разработано для превосходства как над классическими vision-трансформерами, так и над высокопроизводительными сверточными моделями при меньших вычислительных затратах.
5
В работе представлена гибридная архитектура CMT, объединяющая CNN для извлечения локальных признаков и трансформеры для моделирования дальних зависимостей.

Гибридные сети CMT, объединяющие сверточные нейронные сети и визуальные трансформеры, для распознавания изображений

Компромисс между точностью и вычислительной эффективностью, а также моделирование дальних зависимостей и локальной информации в сетях CMT на различных наборах данных для распознавания изображений

Publication Details
Publication Date
2022-06-01
Journal
Publisher
ISSN
Cited by
899
Access Type
Author Information
Authors
Jianyuan Guo
Kai Han
Yunhe Wang
Xinghao Chen
Chang Xu
Yehui Tang
Han Wu
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%