Эмпирическое исследование обучения самоконтролируемых Vision Transformer
An Empirical Study of Training Self-Supervised Vision Transformers
2021-10-01
SCID: 54.1/xngrgc2c
Discuss with AI
MoCo v3ViTVision Transformersсамостоятельное обучениерецепты обучения
Figures from the paper
Abstract (AI)
В статье не описывается новый метод. Вместо этого рассматривается простой, инкрементальный, но обязательный к знакомству базовый подход с учётом недавнего прогресса в компьютерном зрении: самоконтролируемое (self-supervised) обучение для Vision Transformer (ViT). В то время как рецепты обучения для стандартных сверточных сетей стали зрелыми и устойчивыми, рецепты для ViT ещё не выработаны, особенно в сценариях самоконтролируемого обучения, где обучение становится более сложным. В этой работе мы возвращаемся к основам и исследуем влияние нескольких фундаментальных компонентов при обучении самоконтролируемых ViT. Мы наблюдаем, что нестабильность является основной проблемой, снижающей точность, и она может быть скрыта кажущимися хорошими результатами. Мы показываем, что эти результаты на самом деле являются частичным провалом и их можно улучшить при обеспечении большей устойчивости обучения. Мы приводим бенчмарки результатов ViT в MoCo v3 и в нескольких других фреймворках самоконтролируемого обучения с абляциями по разным аспектам. Мы обсуждаем текущие положительные свидетельства, а также проблемы и открытые вопросы. Мы надеемся, что эта работа предоставит полезные данные и опыт для будущих исследований.
Key Findings
1
Бенчмаркинг ViT с MoCo v3 и другими самоконтролируемыми фреймворками вместе с аблациями выявляет важные компоненты, влияющие на производительность и стабильность.
2
Неустойчивость в процессе обучения является основной проблемой для самоконтролируемых ViT, которая ухудшает точность и может скрывать частичные сбои обучения.
3
Стабилизация процедур обучения улучшает внешне хорошие, но частично провалившиеся результаты, обеспечивая лучшую итоговую производительность самоконтролируемого ViT.
4
Исследование документирует положительные свидетельства, проблемы и открытые вопросы, предоставляя эмпирические данные для будущих исследований самоконтролируемого ViT.
5
Обучение самоконтролируемых Vision Transformers (ViT) требует особых рецептов; рецепты для сверточных сетей не переводятся напрямую на ViT в самоконтролируемых сценариях.
Research Object
Модели Vision Transformer (ViT), обучаемые методом самоконтролируемого (self-supervised) обучения
Research Subject
Влияние фундаментальных компонентов обучения и проблем стабильности на производительность самоконтролируемых ViT (включая бенчмарки в MoCo v3 и других фреймворках self-supervised и исследования по отстройке компонентов)
Publication Details
Publication Date
2021-10-01
Journal
Publisher
ISSN
Cited by
1542
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai6
Использование генеративного искусственного интеллекта для масштабирования интеллектуальных обучающих систем2023
Обучение нескольких слоев признаков на маленьких изображениях2024
Фреймворк Aion: размерное возникновение сознания ИИ, коллапс под воздействием наблюдателя и динамика космологических порталов2023
Появляющиеся свойства самоконтролируемых Vision Transformer2021
Изображение стоит 16×16 слов: трансформеры для распознавания изображений в масштабе2020
Нелокальные нейронные сети2018