UNETR: Трансформеры для 3D сегментации медицинских изображений

UNETR: Transformers for 3D Medical Image Segmentation
Bennett A. Landman, Holger R. Roth, Daguang Xu, Ali Hatamizadeh, Yucheng Tang, Vishwesh Nath, Dong Yang, Andriy Myronenko
2022-01-01

3D сегментация медицинских изображенийMulti Atlas Labeling Beyond The Cranial Vault (BTCV)U-образный энкодер-декодер с пропусками (skip connections)UNETRтрансформерный энкодер
Полносверточные нейронные сети (FCNN) с сжимающими и расширяющими путями демонстрировали доминирующее положение в большинстве приложений по сегментации медицинских изображений на протяжении последнего десятилетия. В FCNN энкодер играет ключевую роль, обучая как глобальные, так и локальные признаки и контекстные представления, которые могут быть использованы декодером для предсказания семантического вывода. Несмотря на успехи, локальный характер сверточных слоев в FCNN ограничивает способность учить дальнодействующие пространственные зависимости. Вдохновлённые недавним успехом трансформеров в задачах обработки естественного языка (NLP) для обучения длинных последовательностей, мы переформулируем задачу объёмной (3D) сегментации медицинских изображений как задачу sequence-to-sequence предсказания. Мы предлагаем новую архитектуру под названием UNETR (UNEt TRansformers), которая использует трансформер в качестве энкодера для обучения представлений последовательности входного объёма и эффективного захвата глобальной многомасштабной информации, при этом сохраняя успешную U-образную структуру сети для энкодера и декодера. Энкодер-трансформер напрямую соединён с декодером посредством пропускных соединений (skip connections) на разных разрешениях для вычисления итоговой семантической сегментации. Мы проверили производительность нашего метода на наборе данных Multi Atlas Labeling Beyond The Cranial Vault (BTCV) для сегментации нескольких органов и на наборе Medical Segmentation Decathlon (MSD) для задач сегментации опухоли мозга и селезёнки. Наши бенчмарки демонстрируют новую передовую точность на таблице лидеров BTCV.
1
Предложен UNETR: новая архитектура с трансформерным кодировщиком внутри U-образного энкодер-декодера со скип-соединениями на нескольких разрешениях.
2
Переформулирована задача 3D сегментации медицинских изображений как задача sequence-to-sequence с использованием трансформеров.
3
Трансформерный кодировщик в UNETR эффективно захватывает глобальную мульти-масштабную информацию и дальние пространственные зависимости, с которыми свёртки справляются хуже.
4
UNETR достиг нового state-of-the-art на лидерборде BTCV.
5
UNETR валидирован на наборах данных BTCV (мультиорганная сегментация) и MSD (опухоль мозга и селезёнка).

Объёмные (3D) медицинские изображения для сегментации органов и опухолей (входные тома из наборов данных BTCV и MSD)

Использование трансформерного энкодера в U‑подобной сети (UNETR) для обучения глобальных многомасштабных последовательных представлений и улучшения семантической сегментации за счёт захвата дальнодействующих пространственных зависимостей через соединения энкодера и декодера

Publication Details
Publication Date
2022-01-01
Journal
Publisher
ISSN
Cited by
3160
Access Type
Author Information
Authors
Bennett A. Landman
Holger R. Roth
Daguang Xu
Ali Hatamizadeh
Yucheng Tang
Vishwesh Nath
Dong Yang
Andriy Myronenko
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%