Появляющиеся свойства в самообучающихся Vision Transformer
Emerging Properties in Self-Supervised Vision Transformers
2021-10-01
SCID: 54.1/e5xddv6x
Discuss with AI
DINO (самодистилляция без меток)k-NN классификация на ImageNetмоментум-энкодерсамообучающийся Vision Transformerвозникновение семантической сегментации
Figures from the paper
Abstract (AI)
В настоящей статье мы исследуем, придаёт ли самообучение (self-supervised learning) признакам Vision Transformer (ViT) свойства, отличающие их от сверточных сетей (convnets). Помимо того, что адаптация методов самообучения к этой архитектуре работает особенно хорошо, мы делаем следующие наблюдения: во‑первых, признаки самообучающегося ViT содержат явную информацию о семантической сегментации изображения, что проявляется не так явно для обученных с учителем ViT и для сверточных сетей; во‑вторых, эти признаки также превосходны в качестве k‑NN (k‑nearest neighbors) классификаторов, достигая 78.3% top-1 на ImageNet с маленьким ViT; в‑третьих, для этих эффектов важны momentum encoder, multi-crop обучение и использование маленьких патчей в ViT. Мы реализуем эти выводы в простом методе самообучения под названием DINO, который интерпретируем как форму самодистилляции без меток, и демонстрируем синергию между DINO и ViT, добившись 80.1% top-1 на ImageNet в линейной оценке с ViT-Base.
Key Findings
1
DINO, простой метод self-supervised, интерпретируемый как self-distillation без меток, в сочетании с ViT достигает 80.1% top-1 на ImageNet в линейной оценке с ViT-Base.
2
Моментум-энкодер, обучение с multi-crop и использование маленьких патчей — важные компоненты для сильной производительности self-supervised ViT.
3
Признаки self-supervised ViT хорошо работают как k-NN классификаторы, достигая 78.3% top-1 на ImageNet с небольшой ViT.
4
Самостоятельно обученные (self-supervised) признаки ViT явно кодируют информацию о семантической сегментации, более явно чем в supervised ViT или свёрточных сетях.
Research Object
Модели Vision Transformer (ViT) с самоконтролируемым обучением и их полученные представления признаков
Research Subject
Эмерджентные свойства полученных признаков, включая явную информацию о семантической сегментации, качество k-NN-классификации и факторы, обуславливающие эти свойства (momentum encoder, multi-crop обучение, небольшие патчи), продемонстрированные на методе самоконтролируемого обучения DINO
Publication Details
Publication Date
2021-10-01
Journal
Publisher
ISSN
Cited by
5526
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai7
Использование генеративного искусственного интеллекта для масштабирования интеллектуальных обучающих систем2023
Изображение стоит 16×16 слов: трансформеры для распознавания изображений в масштабе2020
Пайплайн с поддержкой ИИ для динамической генерации достоверного контента о биологически активных добавках в масштабе2018
Глубокое остаточное обучение для распознавания изображений2016
YFCC100M2016
Дистилляция знаний в нейронной сети2015
Нейронный машинный перевод посредством совместного обучения выравниванию и переводу2014
Работы, цитирующие эту статью10
UNETR: Трансформеры для 3D сегментации медицинских изображений2022
Механизмы внимания в компьютерном зрении: обзор2022
Эмпирическое исследование обучения самоконтролируемых Vision Transformer2021
Мультимодальное обучение с трансформерами: обзор2023
Масштабирование Vision Transformer2022
Обучение речевых представлений с самоконтролем: обзор2022
SSAST: аудиоспектрограммный трансформер с самоконтролируемым обучением2022
Мультимодальные базовые модели: от специализированных систем к универсальным помощникам2024
Материаловедение в эпоху больших языковых моделей: перспективный обзор2024
smDeepFLUOR: глубокая нейросетевая классификация флуоресценции на уровне одиночных молекул2025