UNETR: Трансформеры для 3D сегментации медицинских изображений
UNETR: Transformers for 3D Medical Image Segmentation
2022-01-01
SCID: 54.1/gj4brpff
Discuss with AI
3D сегментация медицинских изображенийMulti Atlas Labeling Beyond The Cranial Vault (BTCV)U-образный энкодер-декодер с пропусками (skip connections)UNETRтрансформерный энкодер
Figures from the paper
Abstract (AI)
Полносверточные нейронные сети (FCNN) с сжимающими и расширяющими путями демонстрировали доминирующее положение в большинстве приложений по сегментации медицинских изображений на протяжении последнего десятилетия. В FCNN энкодер играет ключевую роль, обучая как глобальные, так и локальные признаки и контекстные представления, которые могут быть использованы декодером для предсказания семантического вывода. Несмотря на успехи, локальный характер сверточных слоев в FCNN ограничивает способность учить дальнодействующие пространственные зависимости. Вдохновлённые недавним успехом трансформеров в задачах обработки естественного языка (NLP) для обучения длинных последовательностей, мы переформулируем задачу объёмной (3D) сегментации медицинских изображений как задачу sequence-to-sequence предсказания. Мы предлагаем новую архитектуру под названием UNETR (UNEt TRansformers), которая использует трансформер в качестве энкодера для обучения представлений последовательности входного объёма и эффективного захвата глобальной многомасштабной информации, при этом сохраняя успешную U-образную структуру сети для энкодера и декодера. Энкодер-трансформер напрямую соединён с декодером посредством пропускных соединений (skip connections) на разных разрешениях для вычисления итоговой семантической сегментации. Мы проверили производительность нашего метода на наборе данных Multi Atlas Labeling Beyond The Cranial Vault (BTCV) для сегментации нескольких органов и на наборе Medical Segmentation Decathlon (MSD) для задач сегментации опухоли мозга и селезёнки. Наши бенчмарки демонстрируют новую передовую точность на таблице лидеров BTCV.
Key Findings
1
Предложен UNETR: новая архитектура с трансформерным кодировщиком внутри U-образного энкодер-декодера со скип-соединениями на нескольких разрешениях.
2
Переформулирована задача 3D сегментации медицинских изображений как задача sequence-to-sequence с использованием трансформеров.
3
Трансформерный кодировщик в UNETR эффективно захватывает глобальную мульти-масштабную информацию и дальние пространственные зависимости, с которыми свёртки справляются хуже.
4
UNETR достиг нового state-of-the-art на лидерборде BTCV.
5
UNETR валидирован на наборах данных BTCV (мультиорганная сегментация) и MSD (опухоль мозга и селезёнка).
Research Object
Объёмные (3D) медицинские изображения для сегментации органов и опухолей (входные тома из наборов данных BTCV и MSD)
Research Subject
Использование трансформерного энкодера в U‑подобной сети (UNETR) для обучения глобальных многомасштабных последовательных представлений и улучшения семантической сегментации за счёт захвата дальнодействующих пространственных зависимостей через соединения энкодера и декодера
Publication Details
Publication Date
2022-01-01
Journal
Publisher
ISSN
Cited by
3160
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai7
Использование генеративного искусственного интеллекта для масштабирования интеллектуальных обучающих систем2023
Swin Transformer: Иерархический визуальный трансформер с использова́нием сдвинутых окон2021
Появляющиеся свойства самоконтролируемых Vision Transformer2021
Pyramid Vision Transformer: универсальный бэкоун для плотного предсказания без свёрток2021
TransUNet: трансформеры как мощные энкодеры для сегментации медицинских изображений2021
Изображение стоит 16×16 слов: трансформеры для распознавания изображений в масштабе2020
Нелокальные нейронные сети2018