Tokens-to-Token ViT: обучение визуальных трансформеров с нуля на ImageNet
Tokens-to-Token ViT: Training Vision Transformers from Scratch on ImageNet
2021-10-01
SCID: 54.1/pxmpq2k7
Discuss with AI
обучение на ImageNet с нуляT2T-ViTTokens-to-Token Vision Transformerглубокая узкая архитектура трансформерапошаговая трансформация Tokens-to-Token
Figures from the paper
Abstract (AI)
Трансформеры, популярные в языковом моделировании, недавно начали применяться для решения задач компьютерного зрения, например Vision Transformer (ViT) для классификации изображений. Модель ViT разбивает каждое изображение на последовательность токенов фиксированной длины и затем применяет несколько слоев трансформера для моделирования их глобальных взаимосвязей для задачи классификации. Однако ViT демонстрирует худшую производительность по сравнению с сверточными нейронными сетями (CNN), когда обучается с нуля на средних по размеру наборах данных, таких как ImageNet. Мы установили, что это происходит потому, что: (1) простая токенизация входных изображений не моделирует важную локальную структуру, такую как грани и линии между соседними пикселями, что приводит к низкой эффективности использования обучающих примеров; и (2) избыточная архитектура внимания в ViT ограничивает богатство признаков при фиксированных вычислительных ресурсах и ограниченном количестве обучающих примеров. Чтобы преодолеть эти ограничения, мы предлагаем новый Tokens-to-Token Vision Transformer (T2T-ViT), который включает: (1) покадровое преобразование Tokens-to-Token (T2T) для поэтапной структуризации изображения в токены путем рекурсивного аггрегирования соседних токенов в один токен, благодаря чему можно моделировать локальную структуру, представляемую окружением токенов, и уменьшать длину последовательности токенов; и (2) эффективный бэκбон с глубокой и узкой структурой для визуальных трансформеров, мотивированный дизайном CNN после эмпирического исследования. Примечательно, что T2T-ViT сокращает число параметров и MACs по сравнению с базовым ViT вдвое, при этом достигает более чем на 3.0% лучшей точности при обучении с нуля на ImageNet. Он также превосходит ResNet и демонстрирует сопоставимую производительность с MobileNet при прямом обучении на ImageNet. Например, T2T-ViT сопоставимого размера с ResNet-50 (21.5M параметров) может достигать 83.3% top-1 точности при разрешении изображения 384x384 на ImageNet.
Key Findings
1
Введена эффективная глубокая-узкая архитектура для визуальных трансформеров, вдохновленная дизайном CNN, повышающая богатство признаков при фиксированных вычислениях.
2
Предложенная трансформация Tokens-to-Token (T2T) постепенно агрегирует соседние токены для захвата локальной структуры изображения и сокращения длины токенов.
3
T2T-ViT сокращает вдвое число параметров и MAC по сравнению с vanilla ViT и при этом обеспечивает более чем на 3.0% лучшее качество при обучении с нуля на ImageNet.
4
T2T-ViT превосходит ResNets и сопоставим с MobileNets при прямом обучении на ImageNet; T2T-ViT с 21.5M параметров достигает 83.3% top-1 точности при разрешении 384x384.
5
Vanilla ViT работает хуже, чем CNN при обучении с нуля на средних наборах данных вроде ImageNet из-за плохого моделирования локальной структуры и избыточного дизайна внимания.
Research Object
Модель Tokens-to-Token Vision Transformer (T2T-ViT) для классификации изображений, обучаемая с нуля на ImageNet
Research Subject
Улучшение качества обучения с нуля для задачи классификации изображений за счёт поэтапной агрегации локальной структуры изображения в токены (покомерная трансформация Tokens-to-Token) и использования эффективного глубокого узкого бэкбона для снижения числа параметров/MACs и повышения точности на ImageNet
Publication Details
Publication Date
2021-10-01
Journal
Publisher
ISSN
Cited by
2324
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai5
Использование генеративного искусственного интеллекта для масштабирования интеллектуальных обучающих систем2023
Фреймворк Aion: размерное возникновение сознания ИИ, коллапс под воздействием наблюдателя и динамика космологических порталов2023
Изображение стоит 16×16 слов: трансформеры для распознавания изображений в масштабе2020
Нелокальные нейронные сети2018
Дистилляция знаний в нейронной сети2015
Работы, цитирующие эту статью8
Swin Transformer: Иерархический визуальный трансформер с использова́нием сдвинутых окон2021
Pyramid Vision Transformer: универсальный бэкоун для плотного предсказания без свёрток2021
PVT v2: Улучшённые базовые модели с Pyramid Vision Transformer2022
CrossViT: мультишкальный визуальный трансформер с перекрёстным вниманием для классификации изображений2021
CSWin Transformer: универсальный визуальный трансформер с перекрёстными окнами2022
AST: Трансформер аудиоспектрограммы2021
Transformer in Transformer2021
ChatGPT и модели OpenAI: предварительный обзор2023