Transformer in Transformer
Transformer in Transformer
2021-02-27
SCID: 54.1/spmdfd7e
Discuss with AI
точность top-1 на ImageNetTransformer iN Transformer (TNT)внимание внутри локальных патчейвизуальные трансформерывизуальные слова и визуальные предложения
Figures from the paper
Abstract (AI)
Transformer — новый тип нейронной архитектуры, который кодирует входные данные в мощные признаки с помощью механизма внимания. Визуальные трансформеры в основном сначала делят входные изображения на несколько локальных патчей, а затем вычисляют как представления, так и отношения между ними. Поскольку натуральные изображения обладают высокой сложностью с большим количеством деталей и цветовой информации, крупность разбиения на патчи недостаточно тонкая для извлечения признаков объектов на разных масштабах и в разных местах. В этой статье мы указываем, что внимание внутри этих локальных патчей также важно для построения визуальных трансформеров с высокой производительностью, и исследуем новую архитектуру, называемую Transformer iN Transformer (TNT). Конкретно, мы рассматриваем локальные патчи (например, 16×16) как «визуальные предложения» и дополнительно делим их на более мелкие патчи (например, 4×4) как «визуальные слова». Внимание каждого слова вычисляется относительно других слов в данном визуальном предложении с пренебрежимо малыми вычислительными затратами. Признаки как слов, так и предложений агрегируются для усиления способности представления. Эксперименты на нескольких бенчмарках демонстрируют эффективность предложенной архитектуры TNT; например, мы достигаем 81.5% топ-1 точности на ImageNet, что примерно на 1.7% выше, чем у современных визуальных трансформеров с похожими вычислительными затратами. Код на PyTorch доступен по адресу https://github.com/huawei-noah/CV-Backbones, код на MindSpore доступен по адресу https://gitee.com/mindspore/models/tree/master/research/cv/TNT.
Key Findings
1
Достигнута точность top-1 81.5% на ImageNet, что примерно на 1.7% выше по сравнению с современным визуальным трансформером при сопоставимой вычислительной стоимости.
2
Агрегируются признаки слов и предложений для улучшения представлений при незначительных дополнительных вычислительных затратах на внутреннее внимание патчей.
3
Стандартные локальные патчи (например, 16×16) делятся на меньшие суб-патчи (например, 4×4), так что внимание 'слов' вычисляется внутри каждого 'предложения'.
4
Предложена архитектура Transformer in Transformer (TNT), моделирующая внимание как между локальными патчами (предложениями), так и внутри патчей (слов).
5
Предоставлены публичные реализации на PyTorch и MindSpore в указанных репозиториях.
Research Object
Архитектура визуального трансформера Transformer iN Transformer (TNT) для представления изображений
Research Subject
Моделирование и агрегация многошкального внимания внутри патчей («слов») и между патчами («предложениями») для улучшения представления признаков изображений и классификационной точности
Publication Details
Publication Date
2021-02-27
Journal
Publisher
ISSN
Cited by
1016
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai4
Обучение нескольких слоев признаков на маленьких изображениях2024
Переосмысление семантической сегментации с точки зрения sequence-to-sequence на основе трансформеров2021
Tokens-to-Token ViT: обучение визуальных трансформеров с нуля на ImageNet2021
Предобученный трансформер для обработки изображений2021
Работы, цитирующие эту статью4
Swin Transformer: Иерархический визуальный трансформер с использова́нием сдвинутых окон2021
Pyramid Vision Transformer: универсальный бэкоун для плотного предсказания без свёрток2021
PVT v2: Улучшённые базовые модели с Pyramid Vision Transformer2022
CSWin Transformer: универсальный визуальный трансформер с перекрёстными окнами2022