SegFormer: простая и эффективная архитектура для семантической сегментации с использованием трансформеров
SegFormer: Simple and Efficient Design for Semantic Segmentation with Transformers
2021-05-31
SCID: 54.1/y94ty5dn
Discuss with AI
оценка mIoU на ADE20K и CityscapesMLP-декодерSegFormerиерархически структурированный энкодер Transformerмногоуровневые (мультискейл) признаки
Figures from the paper
Abstract (AI)
Мы представляем SegFormer — простую, эффективную и при этом мощную платформу для семантической сегментации, объединяющую трансформеры с легковесными декодерами на основе многослойного перцептрона (MLP). SegFormer обладает двумя важными особенностями: (1) он включает новую иерархически структурированную кодирующую часть на базе трансформера, которая формирует многомасштабные признаки и не требует позиционного кодирования, что позволяет избежать интерполяции позиционных кодов, ухудшающей качество при различии разрешений обучения и тестирования; (2) SegFormer исключает сложные декодеры: предлагаемый MLP-декодер агрегирует информацию из разных слоев, сочетая как локальное, так и глобальное внимание для построения информативных представлений. Мы показываем, что именно простота и лёгкость этой архитектуры являются ключом к эффективной сегментации на базе трансформеров. Мы масштабируем подход, получая серию моделей от SegFormer-B0 до SegFormer-B5, которые превосходят предыдущие аналоги по точности и эффективности. Например, SegFormer-B4 достигает 50.3% mIoU на наборе ADE20K с 64M параметров, что в 5 раз компактнее и на 2.2% лучше предыдущего лучшего метода. Наша лучшая модель, SegFormer-B5, достигает 84.0% mIoU на валидационном наборе Cityscapes и демонстрирует отличную нулевую (zero-shot) устойчивость на Cityscapes-C. Код будет опубликован по адресу: github.com/NVlabs/SegFormer.
Key Findings
1
Отказ от позиционной кодировки предотвращает падение производительности при тестировании на разрешениях, отличных от тренировочных.
2
SegFormer представляет иерархически структурированный Transformer-энкодер, выдающий многоуровневые признаки без позиционной кодировки.
3
SegFormer использует простой легковесный MLP-декодер, агрегирующий признаки с разных слоев и сочетая локальное и глобальное внимание.
4
SegFormer-B4 достигает 50.3% mIoU на ADE20K с 64M параметров, будучи в 5 раз меньше и на 2.2% лучше предыдущего лучшего метода.
5
SegFormer-B5 достигает 84.0% mIoU на валидации Cityscapes и демонстрирует сильную zero-shot робастность на Cityscapes-C.
6
Простая архитектура энкодер-декодер обеспечивает эффективную сегментацию с лучшей производительностью и эффективностью по сравнению с предыдущими методами.
Research Object
Фреймворк семантической сегментации SegFormer (иерархический Transformer-энкодер с лёгким MLP-декодером) и его модели
Research Subject
Эффективность и производительность дизайна для семантической сегментации, включая многомасштабное кодирование признаков без позиционного кодирования, агрегирование локального и глобального внимания MLP-декодером, масштабирование моделей (B0–B5) и связанные показатели сегментации и робастности (mIoU, число параметров, нулёвая-shot робастность)
Publication Details
Publication Date
2021-05-31
Journal
Publisher
ISSN
Cited by
3363
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai6
Swin Transformer: Иерархический визуальный трансформер с использова́нием сдвинутых окон2021
Pyramid Vision Transformer: универсальный бэкоун для плотного предсказания без свёрток2021
Переосмысление семантической сегментации с точки зрения sequence-to-sequence на основе трансформеров2021
CrossViT: мультишкальный визуальный трансформер с перекрёстным вниманием для классификации изображений2021
Изображение стоит 16×16 слов: трансформеры для распознавания изображений в масштабе2020
Нелокальные нейронные сети2018