Tokens-to-Token ViT: обучение визуальных трансформеров с нуля на ImageNet

Tokens-to-Token ViT: Training Vision Transformers from Scratch on ImageNet
Weihao Yu, Shuicheng Yan, Jiashi Feng, Li Yuan, Yunpeng Chen, Tao Wang, Yujun Shi, Zihang Jiang, Francis E. H. Tay
2021-10-01

обучение на ImageNet с нуляT2T-ViTTokens-to-Token Vision Transformerглубокая узкая архитектура трансформерапошаговая трансформация Tokens-to-Token
Трансформеры, популярные в языковом моделировании, недавно начали применяться для решения задач компьютерного зрения, например Vision Transformer (ViT) для классификации изображений. Модель ViT разбивает каждое изображение на последовательность токенов фиксированной длины и затем применяет несколько слоев трансформера для моделирования их глобальных взаимосвязей для задачи классификации. Однако ViT демонстрирует худшую производительность по сравнению с сверточными нейронными сетями (CNN), когда обучается с нуля на средних по размеру наборах данных, таких как ImageNet. Мы установили, что это происходит потому, что: (1) простая токенизация входных изображений не моделирует важную локальную структуру, такую как грани и линии между соседними пикселями, что приводит к низкой эффективности использования обучающих примеров; и (2) избыточная архитектура внимания в ViT ограничивает богатство признаков при фиксированных вычислительных ресурсах и ограниченном количестве обучающих примеров. Чтобы преодолеть эти ограничения, мы предлагаем новый Tokens-to-Token Vision Transformer (T2T-ViT), который включает: (1) покадровое преобразование Tokens-to-Token (T2T) для поэтапной структуризации изображения в токены путем рекурсивного аггрегирования соседних токенов в один токен, благодаря чему можно моделировать локальную структуру, представляемую окружением токенов, и уменьшать длину последовательности токенов; и (2) эффективный бэκбон с глубокой и узкой структурой для визуальных трансформеров, мотивированный дизайном CNN после эмпирического исследования. Примечательно, что T2T-ViT сокращает число параметров и MACs по сравнению с базовым ViT вдвое, при этом достигает более чем на 3.0% лучшей точности при обучении с нуля на ImageNet. Он также превосходит ResNet и демонстрирует сопоставимую производительность с MobileNet при прямом обучении на ImageNet. Например, T2T-ViT сопоставимого размера с ResNet-50 (21.5M параметров) может достигать 83.3% top-1 точности при разрешении изображения 384x384 на ImageNet.
1
Введена эффективная глубокая-узкая архитектура для визуальных трансформеров, вдохновленная дизайном CNN, повышающая богатство признаков при фиксированных вычислениях.
2
Предложенная трансформация Tokens-to-Token (T2T) постепенно агрегирует соседние токены для захвата локальной структуры изображения и сокращения длины токенов.
3
T2T-ViT сокращает вдвое число параметров и MAC по сравнению с vanilla ViT и при этом обеспечивает более чем на 3.0% лучшее качество при обучении с нуля на ImageNet.
4
T2T-ViT превосходит ResNets и сопоставим с MobileNets при прямом обучении на ImageNet; T2T-ViT с 21.5M параметров достигает 83.3% top-1 точности при разрешении 384x384.
5
Vanilla ViT работает хуже, чем CNN при обучении с нуля на средних наборах данных вроде ImageNet из-за плохого моделирования локальной структуры и избыточного дизайна внимания.

Модель Tokens-to-Token Vision Transformer (T2T-ViT) для классификации изображений, обучаемая с нуля на ImageNet

Улучшение качества обучения с нуля для задачи классификации изображений за счёт поэтапной агрегации локальной структуры изображения в токены (покомерная трансформация Tokens-to-Token) и использования эффективного глубокого узкого бэкбона для снижения числа параметров/MACs и повышения точности на ImageNet

Publication Details
Publication Date
2021-10-01
Journal
Publisher
ISSN
Cited by
2324
Access Type
Author Information
Authors
Weihao Yu
Shuicheng Yan
Jiashi Feng
Li Yuan
Yunpeng Chen
Tao Wang
Yujun Shi
Zihang Jiang
Francis E. H. Tay
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%