Появляющиеся свойства в самообучающихся Vision Transformer

Emerging Properties in Self-Supervised Vision Transformers
Hugo Touvron, Hervé Jeǵou, Armand Joulin, Ishan Misra, Julien Mairal, Mathilde Caron, Piotr Bojanowski
2021-10-01

DINO (самодистилляция без меток)k-NN классификация на ImageNetмоментум-энкодерсамообучающийся Vision Transformerвозникновение семантической сегментации
В настоящей статье мы исследуем, придаёт ли самообучение (self-supervised learning) признакам Vision Transformer (ViT) свойства, отличающие их от сверточных сетей (convnets). Помимо того, что адаптация методов самообучения к этой архитектуре работает особенно хорошо, мы делаем следующие наблюдения: во‑первых, признаки самообучающегося ViT содержат явную информацию о семантической сегментации изображения, что проявляется не так явно для обученных с учителем ViT и для сверточных сетей; во‑вторых, эти признаки также превосходны в качестве k‑NN (k‑nearest neighbors) классификаторов, достигая 78.3% top-1 на ImageNet с маленьким ViT; в‑третьих, для этих эффектов важны momentum encoder, multi-crop обучение и использование маленьких патчей в ViT. Мы реализуем эти выводы в простом методе самообучения под названием DINO, который интерпретируем как форму самодистилляции без меток, и демонстрируем синергию между DINO и ViT, добившись 80.1% top-1 на ImageNet в линейной оценке с ViT-Base.
1
DINO, простой метод self-supervised, интерпретируемый как self-distillation без меток, в сочетании с ViT достигает 80.1% top-1 на ImageNet в линейной оценке с ViT-Base.
2
Моментум-энкодер, обучение с multi-crop и использование маленьких патчей — важные компоненты для сильной производительности self-supervised ViT.
3
Признаки self-supervised ViT хорошо работают как k-NN классификаторы, достигая 78.3% top-1 на ImageNet с небольшой ViT.
4
Самостоятельно обученные (self-supervised) признаки ViT явно кодируют информацию о семантической сегментации, более явно чем в supervised ViT или свёрточных сетях.

Модели Vision Transformer (ViT) с самоконтролируемым обучением и их полученные представления признаков

Эмерджентные свойства полученных признаков, включая явную информацию о семантической сегментации, качество k-NN-классификации и факторы, обуславливающие эти свойства (momentum encoder, multi-crop обучение, небольшие патчи), продемонстрированные на методе самоконтролируемого обучения DINO

Publication Details
Publication Date
2021-10-01
Journal
Publisher
ISSN
Cited by
5526
Access Type
Author Information
Authors
Hugo Touvron
Hervé Jeǵou
Armand Joulin
Ishan Misra
Julien Mairal
Mathilde Caron
Piotr Bojanowski
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%