Transformer in Transformer

Transformer in Transformer
Jianyuan Guo, Kai Han, Chunjing Xu, Yunhe Wang, An Xiao, Enhua Wu
2021-02-27

точность top-1 на ImageNetTransformer iN Transformer (TNT)внимание внутри локальных патчейвизуальные трансформерывизуальные слова и визуальные предложения
Transformer — новый тип нейронной архитектуры, который кодирует входные данные в мощные признаки с помощью механизма внимания. Визуальные трансформеры в основном сначала делят входные изображения на несколько локальных патчей, а затем вычисляют как представления, так и отношения между ними. Поскольку натуральные изображения обладают высокой сложностью с большим количеством деталей и цветовой информации, крупность разбиения на патчи недостаточно тонкая для извлечения признаков объектов на разных масштабах и в разных местах. В этой статье мы указываем, что внимание внутри этих локальных патчей также важно для построения визуальных трансформеров с высокой производительностью, и исследуем новую архитектуру, называемую Transformer iN Transformer (TNT). Конкретно, мы рассматриваем локальные патчи (например, 16×16) как «визуальные предложения» и дополнительно делим их на более мелкие патчи (например, 4×4) как «визуальные слова». Внимание каждого слова вычисляется относительно других слов в данном визуальном предложении с пренебрежимо малыми вычислительными затратами. Признаки как слов, так и предложений агрегируются для усиления способности представления. Эксперименты на нескольких бенчмарках демонстрируют эффективность предложенной архитектуры TNT; например, мы достигаем 81.5% топ-1 точности на ImageNet, что примерно на 1.7% выше, чем у современных визуальных трансформеров с похожими вычислительными затратами. Код на PyTorch доступен по адресу https://github.com/huawei-noah/CV-Backbones, код на MindSpore доступен по адресу https://gitee.com/mindspore/models/tree/master/research/cv/TNT.
1
Достигнута точность top-1 81.5% на ImageNet, что примерно на 1.7% выше по сравнению с современным визуальным трансформером при сопоставимой вычислительной стоимости.
2
Агрегируются признаки слов и предложений для улучшения представлений при незначительных дополнительных вычислительных затратах на внутреннее внимание патчей.
3
Стандартные локальные патчи (например, 16×16) делятся на меньшие суб-патчи (например, 4×4), так что внимание 'слов' вычисляется внутри каждого 'предложения'.
4
Предложена архитектура Transformer in Transformer (TNT), моделирующая внимание как между локальными патчами (предложениями), так и внутри патчей (слов).
5
Предоставлены публичные реализации на PyTorch и MindSpore в указанных репозиториях.

Архитектура визуального трансформера Transformer iN Transformer (TNT) для представления изображений

Моделирование и агрегация многошкального внимания внутри патчей («слов») и между патчами («предложениями») для улучшения представления признаков изображений и классификационной точности

Publication Details
Publication Date
2021-02-27
Journal
Publisher
ISSN
Cited by
1016
Access Type
Author Information
Authors
Jianyuan Guo
Kai Han
Chunjing Xu
Yunhe Wang
An Xiao
Enhua Wu
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%