SegFormer: простая и эффективная архитектура для семантической сегментации с использованием трансформеров

SegFormer: Simple and Efficient Design for Semantic Segmentation with Transformers
Wenhai Wang, Enze Xie, Ping Luo, Anima Anandkumar, Jose M. Álvarez, Zhiding Yu, Wenhai Wang
2021-05-31

оценка mIoU на ADE20K и CityscapesMLP-декодерSegFormerиерархически структурированный энкодер Transformerмногоуровневые (мультискейл) признаки
Мы представляем SegFormer — простую, эффективную и при этом мощную платформу для семантической сегментации, объединяющую трансформеры с легковесными декодерами на основе многослойного перцептрона (MLP). SegFormer обладает двумя важными особенностями: (1) он включает новую иерархически структурированную кодирующую часть на базе трансформера, которая формирует многомасштабные признаки и не требует позиционного кодирования, что позволяет избежать интерполяции позиционных кодов, ухудшающей качество при различии разрешений обучения и тестирования; (2) SegFormer исключает сложные декодеры: предлагаемый MLP-декодер агрегирует информацию из разных слоев, сочетая как локальное, так и глобальное внимание для построения информативных представлений. Мы показываем, что именно простота и лёгкость этой архитектуры являются ключом к эффективной сегментации на базе трансформеров. Мы масштабируем подход, получая серию моделей от SegFormer-B0 до SegFormer-B5, которые превосходят предыдущие аналоги по точности и эффективности. Например, SegFormer-B4 достигает 50.3% mIoU на наборе ADE20K с 64M параметров, что в 5 раз компактнее и на 2.2% лучше предыдущего лучшего метода. Наша лучшая модель, SegFormer-B5, достигает 84.0% mIoU на валидационном наборе Cityscapes и демонстрирует отличную нулевую (zero-shot) устойчивость на Cityscapes-C. Код будет опубликован по адресу: github.com/NVlabs/SegFormer.
1
Отказ от позиционной кодировки предотвращает падение производительности при тестировании на разрешениях, отличных от тренировочных.
2
SegFormer представляет иерархически структурированный Transformer-энкодер, выдающий многоуровневые признаки без позиционной кодировки.
3
SegFormer использует простой легковесный MLP-декодер, агрегирующий признаки с разных слоев и сочетая локальное и глобальное внимание.
4
SegFormer-B4 достигает 50.3% mIoU на ADE20K с 64M параметров, будучи в 5 раз меньше и на 2.2% лучше предыдущего лучшего метода.
5
SegFormer-B5 достигает 84.0% mIoU на валидации Cityscapes и демонстрирует сильную zero-shot робастность на Cityscapes-C.
6
Простая архитектура энкодер-декодер обеспечивает эффективную сегментацию с лучшей производительностью и эффективностью по сравнению с предыдущими методами.

Фреймворк семантической сегментации SegFormer (иерархический Transformer-энкодер с лёгким MLP-декодером) и его модели

Эффективность и производительность дизайна для семантической сегментации, включая многомасштабное кодирование признаков без позиционного кодирования, агрегирование локального и глобального внимания MLP-декодером, масштабирование моделей (B0–B5) и связанные показатели сегментации и робастности (mIoU, число параметров, нулёвая-shot робастность)

Publication Details
Publication Date
2021-05-31
Journal
Publisher
ISSN
Cited by
3363
Access Type
Author Information
Authors
Wenhai Wang
Enze Xie
Ping Luo
Anima Anandkumar
Jose M. Álvarez
Zhiding Yu
Wenhai Wang
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%