Переосмысление семантической сегментации с точки зрения sequence-to-sequence на основе трансформеров

Rethinking Semantic Segmentation from a Sequence-to-Sequence Perspective with Transformers
Hengshuang Zhao, Philip H. S. Torr, Jianfeng Feng, Tao Xiang, Sixiao Zheng, Jiachen Lu, Xiatian Zhu, Zekun Luo, Yabiao Wang, Yanwei Fu, Li Zhang
2021-06-01

ADE20K mIoUSEgmentation TRansformer (SETR)сегментация изображенийпоследовательность-в-последовательность (sequence-to-sequence)кодировщик Transformer
Большинство современных методов семантической сегментации используют полностью сверточную сеть (FCN) с архитектурой «энкодер-декодер». Энкодер постепенно уменьшает пространственное разрешение и изучает более абстрактные/семантические визуальные концепции с большими рецептивными полями. Поскольку моделирование контекста критично для сегментации, последние усилия были направлены на увеличение рецептивного поля, либо за счёт дилатированных/атроусных свёрток, либо путем внедрения модулей внимания. Тем не менее архитектура FCN на основе энкодера-декодера остаётся неизменной. В этой работе мы предлагаем альтернативную точку зрения, рассматривая семантическую сегментацию как задачу sequence-to-sequence предсказания. В частности, мы используем чистый трансформер (т.е. без свёрток и без уменьшения разрешения) для кодирования изображения в виде последовательности патчей. Благодаря глобальному контексту, моделируемому на каждом слое трансформера, этот энкодер можно комбинировать с простым декодером для получения мощной модели сегментации, названной SEgmentation TRansformer (SETR). Широкие эксперименты показывают, что SETR достигает нового состояния искусства на ADE20K (50.28% mIoU), Pascal Context (55.83% mIoU) и конкурентоспособных результатов на Cityscapes. В частности, в день подачи статьи мы заняли первое место в очень конкурентном лидере-борде тестового сервера ADE20K.
1
На момент подачи работа SETR заняла первое место в рейтинге тестового сервера ADE20K
2
Представлен SEgmentation TRansformer (SETR), объединяющий трансформерный энкодер с простым декодером для сегментации
3
Предложено рассматривать семантическую сегментацию как задачу sequence-to-sequence, используя чистый трансформерный энкодер без свёрток и уменьшения разрешения
4
SETR достигает состояния искусства на ADE20K с 50.28% mIoU
5
SETR достигает состояния искусства на Pascal Context с 55.83% mIoU и показывает сопоставимые результаты на Cityscapes
6
Трансформерный энкодер моделирует глобальный контекст на каждом слое, кодируя изображение как последовательность патчей

Модель семантической сегментации на основе чистого трансформера с кодировщиком, рассматривающим изображение как последовательность патчей (SETR)

Эффективность последовательного (sequence-to-sequence) кодирования изображений трансформером (без сверточных слоёв и понижения разрешения) в сочетании с простым декодером для моделирования глобального контекста и улучшения качества сегментации (mIoU) на наборах данных ADE20K, Pascal Context и Cityscapes

Publication Details
Publication Date
2021-06-01
Journal
Publisher
ISSN
Cited by
3671
Access Type
Author Information
Authors
Hengshuang Zhao
Philip H. S. Torr
Jianfeng Feng
Tao Xiang
Sixiao Zheng
Jiachen Lu
Xiatian Zhu
Zekun Luo
Yabiao Wang
Yanwei Fu
Li Zhang
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%