Эмпирическое исследование обучения самоконтролируемых Vision Transformer

An Empirical Study of Training Self-Supervised Vision Transformers
Kaiming He, Saining Xie, Xinlei Chen
2021-10-01

MoCo v3ViTVision Transformersсамостоятельное обучениерецепты обучения
В статье не описывается новый метод. Вместо этого рассматривается простой, инкрементальный, но обязательный к знакомству базовый подход с учётом недавнего прогресса в компьютерном зрении: самоконтролируемое (self-supervised) обучение для Vision Transformer (ViT). В то время как рецепты обучения для стандартных сверточных сетей стали зрелыми и устойчивыми, рецепты для ViT ещё не выработаны, особенно в сценариях самоконтролируемого обучения, где обучение становится более сложным. В этой работе мы возвращаемся к основам и исследуем влияние нескольких фундаментальных компонентов при обучении самоконтролируемых ViT. Мы наблюдаем, что нестабильность является основной проблемой, снижающей точность, и она может быть скрыта кажущимися хорошими результатами. Мы показываем, что эти результаты на самом деле являются частичным провалом и их можно улучшить при обеспечении большей устойчивости обучения. Мы приводим бенчмарки результатов ViT в MoCo v3 и в нескольких других фреймворках самоконтролируемого обучения с абляциями по разным аспектам. Мы обсуждаем текущие положительные свидетельства, а также проблемы и открытые вопросы. Мы надеемся, что эта работа предоставит полезные данные и опыт для будущих исследований.
1
Бенчмаркинг ViT с MoCo v3 и другими самоконтролируемыми фреймворками вместе с аблациями выявляет важные компоненты, влияющие на производительность и стабильность.
2
Неустойчивость в процессе обучения является основной проблемой для самоконтролируемых ViT, которая ухудшает точность и может скрывать частичные сбои обучения.
3
Стабилизация процедур обучения улучшает внешне хорошие, но частично провалившиеся результаты, обеспечивая лучшую итоговую производительность самоконтролируемого ViT.
4
Исследование документирует положительные свидетельства, проблемы и открытые вопросы, предоставляя эмпирические данные для будущих исследований самоконтролируемого ViT.
5
Обучение самоконтролируемых Vision Transformers (ViT) требует особых рецептов; рецепты для сверточных сетей не переводятся напрямую на ViT в самоконтролируемых сценариях.

Модели Vision Transformer (ViT), обучаемые методом самоконтролируемого (self-supervised) обучения

Влияние фундаментальных компонентов обучения и проблем стабильности на производительность самоконтролируемых ViT (включая бенчмарки в MoCo v3 и других фреймворках self-supervised и исследования по отстройке компонентов)

Publication Details
Publication Date
2021-10-01
Journal
Publisher
ISSN
Cited by
1542
Access Type
Author Information
Authors
Kaiming He
Saining Xie
Xinlei Chen
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%