Масштабирование Vision Transformer
Scaling Vision Transformers
2022-06-01
SCID: 54.1/2ea79bq5
Discuss with AI
точность ImageNet top-1 90.45%Vision Transformerмасштабирование данныхмасштабирование моделизаконы масштабирования
Figures from the paper
Abstract (AI)
Нейронные сети на основе внимания, такие как Vision Transformer (ViT), недавно достигли передовых результатов по многим бенчмаркам компьютерного зрения. Масштаб является ключевым фактором для достижения выдающихся результатов; поэтому понимание свойств масштабирования модели важно для эффективного проектирования следующих поколений. В то время как законы масштабирования трансформеров для языковых моделей изучены, неизвестно, как масштабируются Vision Transformer. Чтобы выяснить это, мы масштабируем модели ViT и данные как вверх, так и вниз, и характеризуем взаимосвязи между уровнем ошибки, объёмом данных и вычислительными ресурсами. По ходу работы мы улучшаем архитектуру и обучение ViT, снижая потребление памяти и повышая точность получаемых моделей. В результате нам удалось обучить модель ViT с двумя миллиардами параметров, которая устанавливает новый рекорд на ImageNet — 90.45% top-1 точности. Модель также показывает хорошие результаты при few-shot переносе, например, достигая 84.86% top-1 точности на ImageNet при всего 10 примерах на класс.
Key Findings
1
Успешно обучена модель ViT с двумя миллиардами параметров, достигшая нового рекорда на ImageNet: 90.45% точности top-1.
2
Уточнения архитектуры и обучения ViT сократили потребление памяти и повысили точность полученных моделей.
3
Большая модель ViT демонстрирует сильный few-shot перенос, достигая 84.86% точности top-1 на ImageNet при всего 10 примерах на класс.
4
Характеризованы отношения между скоростью ошибок, данными и вычислениями для Vision Transformers (ViT) путем масштабирования моделей и данных вверх и вниз.
Research Object
Модели Vision Transformer (ViT) и их масштабирование (масштаб модели и набора данных по числу параметров и объёму данных)
Research Subject
Зависимости между ошибкой, объёмом данных и вычислительными ресурсами при масштабировании моделей ViT и данных; архитектурные и тренировочные улучшения, влияющие на расход памяти и точность
Publication Details
Publication Date
2022-06-01
Journal
Publisher
ISSN
Cited by
835
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai5
Использование генеративного искусственного интеллекта для масштабирования интеллектуальных обучающих систем2023
Обучение нескольких слоев признаков на маленьких изображениях2024
Фреймворк Aion: размерное возникновение сознания ИИ, коллапс под воздействием наблюдателя и динамика космологических порталов2023
Появляющиеся свойства самоконтролируемых Vision Transformer2021
Pyramid Vision Transformer: универсальный бэкоун для плотного предсказания без свёрток2021