CMT: сверточные нейронные сети встречаются с визуальными трансформерами
CMT: Convolutional Neural Networks Meet Vision Transformers
2022-06-01
SCID: 54.1/tp68jw4b
Discuss with AI
ImageNetвычислительная эффективностьсверточные нейронные сетигибридная сетьвизуальные трансформеры
Figures from the paper
Abstract (AI)
Визуальные трансформеры успешно применяются для решения задач распознавания изображений благодаря способности выявлять дальние зависимости внутри изображения. Однако между трансформерами и существующими сверточными нейронными сетями (CNN) по-прежнему сохраняются различия как в производительности, так и в вычислительных затратах. В этой статье мы стремимся решить эту проблему и разработать сеть, превосходящую не только классические трансформеры, но и высокопроизводительные сверточные модели. Мы предлагаем новую гибридную сеть на основе трансформера, использующую трансформеры для выявления дальних зависимостей, а CNN — для извлечения локальной информации. Кроме того, мы масштабируем ее, получая семейство моделей под названием CMT, которые обеспечивают значительно более выгодный компромисс между точностью и эффективностью по сравнению с предыдущими моделями на основе CNN и трансформеров. В частности, наша модель CMT-S достигает точности top-1 83,5% на ImageNet, используя в 14 и 2 раза меньше FLOPs, чем существующие модели DeiT и EfficientNet соответственно. Предложенная CMT-S также хорошо обобщается на CIFAR10 (99,2%), CIFAR100 (91,7%), Flowers (98,7%) и другие сложные наборы данных для компьютерного зрения, такие как COCO (44,3% mAP), при значительно меньших вычислительных затратах.
Key Findings
1
Модели CMT обеспечивают более выгодный компромисс между точностью и эффективностью по сравнению с предыдущими CNN- и трансформерными архитектурами.
2
CMT-S демонстрирует высокую обобщающую способность: 99,2% на CIFAR10, 91,7% на CIFAR100, 98,7% на Flowers и 44,3% mAP на COCO.
3
CMT-S достигает точности 83,5% top-1 на ImageNet, используя в 14 раз меньше FLOPs, чем DeiT, и в 2 раза меньше, чем EfficientNet.
4
Семейство CMT разработано для превосходства как над классическими vision-трансформерами, так и над высокопроизводительными сверточными моделями при меньших вычислительных затратах.
5
В работе представлена гибридная архитектура CMT, объединяющая CNN для извлечения локальных признаков и трансформеры для моделирования дальних зависимостей.
Research Object
Гибридные сети CMT, объединяющие сверточные нейронные сети и визуальные трансформеры, для распознавания изображений
Research Subject
Компромисс между точностью и вычислительной эффективностью, а также моделирование дальних зависимостей и локальной информации в сетях CMT на различных наборах данных для распознавания изображений
Publication Details
Publication Date
2022-06-01
Journal
Publisher
ISSN
Cited by
899
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai5
Использование генеративного искусственного интеллекта для масштабирования интеллектуальных обучающих систем2023
Swin Transformer: Иерархический визуальный трансформер с использова́нием сдвинутых окон2021
Обучение нескольких слоев признаков на маленьких изображениях2024
Pyramid Vision Transformer: универсальный бэкоун для плотного предсказания без свёрток2021
Нелокальные нейронные сети2018