Масштабирование Vision Transformer

Scaling Vision Transformers
Xiaohua Zhai, Alexander Kolesnikov, Neil Houlsby, Lucas Beyer
2022-06-01

точность ImageNet top-1 90.45%Vision Transformerмасштабирование данныхмасштабирование моделизаконы масштабирования
Нейронные сети на основе внимания, такие как Vision Transformer (ViT), недавно достигли передовых результатов по многим бенчмаркам компьютерного зрения. Масштаб является ключевым фактором для достижения выдающихся результатов; поэтому понимание свойств масштабирования модели важно для эффективного проектирования следующих поколений. В то время как законы масштабирования трансформеров для языковых моделей изучены, неизвестно, как масштабируются Vision Transformer. Чтобы выяснить это, мы масштабируем модели ViT и данные как вверх, так и вниз, и характеризуем взаимосвязи между уровнем ошибки, объёмом данных и вычислительными ресурсами. По ходу работы мы улучшаем архитектуру и обучение ViT, снижая потребление памяти и повышая точность получаемых моделей. В результате нам удалось обучить модель ViT с двумя миллиардами параметров, которая устанавливает новый рекорд на ImageNet — 90.45% top-1 точности. Модель также показывает хорошие результаты при few-shot переносе, например, достигая 84.86% top-1 точности на ImageNet при всего 10 примерах на класс.
1
Успешно обучена модель ViT с двумя миллиардами параметров, достигшая нового рекорда на ImageNet: 90.45% точности top-1.
2
Уточнения архитектуры и обучения ViT сократили потребление памяти и повысили точность полученных моделей.
3
Большая модель ViT демонстрирует сильный few-shot перенос, достигая 84.86% точности top-1 на ImageNet при всего 10 примерах на класс.
4
Характеризованы отношения между скоростью ошибок, данными и вычислениями для Vision Transformers (ViT) путем масштабирования моделей и данных вверх и вниз.

Модели Vision Transformer (ViT) и их масштабирование (масштаб модели и набора данных по числу параметров и объёму данных)

Зависимости между ошибкой, объёмом данных и вычислительными ресурсами при масштабировании моделей ViT и данных; архитектурные и тренировочные улучшения, влияющие на расход памяти и точность

Publication Details
Publication Date
2022-06-01
Journal
Publisher
ISSN
Cited by
835
Access Type
Author Information
Authors
Xiaohua Zhai
Alexander Kolesnikov
Neil Houlsby
Lucas Beyer
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%