Переосмысление семантической сегментации с точки зрения sequence-to-sequence на основе трансформеров
Rethinking Semantic Segmentation from a Sequence-to-Sequence Perspective with Transformers
2021-06-01
SCID: 54.1/vxbtezdr
Discuss with AI
ADE20K mIoUSEgmentation TRansformer (SETR)сегментация изображенийпоследовательность-в-последовательность (sequence-to-sequence)кодировщик Transformer
Figures from the paper
Abstract (AI)
Большинство современных методов семантической сегментации используют полностью сверточную сеть (FCN) с архитектурой «энкодер-декодер». Энкодер постепенно уменьшает пространственное разрешение и изучает более абстрактные/семантические визуальные концепции с большими рецептивными полями. Поскольку моделирование контекста критично для сегментации, последние усилия были направлены на увеличение рецептивного поля, либо за счёт дилатированных/атроусных свёрток, либо путем внедрения модулей внимания. Тем не менее архитектура FCN на основе энкодера-декодера остаётся неизменной. В этой работе мы предлагаем альтернативную точку зрения, рассматривая семантическую сегментацию как задачу sequence-to-sequence предсказания. В частности, мы используем чистый трансформер (т.е. без свёрток и без уменьшения разрешения) для кодирования изображения в виде последовательности патчей. Благодаря глобальному контексту, моделируемому на каждом слое трансформера, этот энкодер можно комбинировать с простым декодером для получения мощной модели сегментации, названной SEgmentation TRansformer (SETR). Широкие эксперименты показывают, что SETR достигает нового состояния искусства на ADE20K (50.28% mIoU), Pascal Context (55.83% mIoU) и конкурентоспособных результатов на Cityscapes. В частности, в день подачи статьи мы заняли первое место в очень конкурентном лидере-борде тестового сервера ADE20K.
Key Findings
1
На момент подачи работа SETR заняла первое место в рейтинге тестового сервера ADE20K
2
Представлен SEgmentation TRansformer (SETR), объединяющий трансформерный энкодер с простым декодером для сегментации
3
Предложено рассматривать семантическую сегментацию как задачу sequence-to-sequence, используя чистый трансформерный энкодер без свёрток и уменьшения разрешения
4
SETR достигает состояния искусства на ADE20K с 50.28% mIoU
5
SETR достигает состояния искусства на Pascal Context с 55.83% mIoU и показывает сопоставимые результаты на Cityscapes
6
Трансформерный энкодер моделирует глобальный контекст на каждом слое, кодируя изображение как последовательность патчей
Research Object
Модель семантической сегментации на основе чистого трансформера с кодировщиком, рассматривающим изображение как последовательность патчей (SETR)
Research Subject
Эффективность последовательного (sequence-to-sequence) кодирования изображений трансформером (без сверточных слоёв и понижения разрешения) в сочетании с простым декодером для моделирования глобального контекста и улучшения качества сегментации (mIoU) на наборах данных ADE20K, Pascal Context и Cityscapes
Publication Details
Publication Date
2021-06-01
Journal
Publisher
ISSN
Cited by
3671
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai4
Работы, цитирующие эту статью7
Swin Transformer: Иерархический визуальный трансформер с использова́нием сдвинутых окон2021
SwinIR: восстановление изображений с использованием Swin Transformer2021
Restormer: эффективный Transformer для восстановления изображений высокого разрешения2022
TransUNet: трансформеры как мощные энкодеры для сегментации медицинских изображений2021
SegFormer: простая и эффективная архитектура для семантической сегментации с использованием трансформеров2021
CSWin Transformer: универсальный визуальный трансформер с перекрёстными окнами2022
Transformer in Transformer2021