Универсальная модель на основе CLIP для сегментации органов и обнаружения опухолей
CLIP-Driven Universal Model for Organ Segmentation and Tumor Detection
2023-10-01
SCID: 54.1/rmv4xm88
Discuss with AI
Beyond The Cranial VaultCLIP-Driven Universal ModelContrastive Language-Image Pre-trainingMedical Segmentation Decathlonкомпьютерная томографияобучение на нескольких наборах данныхсегментация органовтекстовые встраиванияперенос обученияобнаружение опухолей
Figures from the paper
Abstract (AI)
Растущее число открытых датасетов значительно влияет на автоматическую сегментацию органов и обнаружение опухолей. Однако из-за малого объема и частичной маркировки каждого датасета, а также ограниченного изучения разнообразных типов опухолей, получаемые модели часто ограничиваются сегментацией конкретных органов или опухолей, не учитывают семантику анатомических структур и не могут быть расширены на новые домены. Для решения этих проблем мы предлагаем Универсальную модель на основе CLIP, которая интегрирует текстовые эмбеддинги, обученные методом контрастивного предварительного обучения языка и изображений (Contrastive Language–Image Pre-training, CLIP), в модели сегментации. Это кодирование меток на основе CLIP улавливает анатомические отношения, позволяя модели выучивать структурированное признаковое представление и сегментировать 25 органов и 6 типов опухолей. Предложенная модель разработана на основе сборки из 14 датасетов с использованием в общей сложности 3 410 КТ-снимков для обучения и затем оценена на 6 162 внешних КТ-снимках из 3 дополнительных датасетов. Мы занимаем первое место в публичном рейтинге Medical Segmentation Decathlon (MSD) и достигаем передовых результатов в Beyond The Cranial Vault (BTCV). Кроме того, Универсальная модель вычислительно более эффективна (в 6× быстрее) по сравнению со специфичными для датасетов моделями, лучше обобщается на КТ-снимки с разных площадок и демонстрирует более сильные результаты при переносном обучении на новые задачи.
Key Findings
1
Включение текстовых эмбеддингов CLIP в сегментационные модели позволяет захватывать анатомические отношения и формировать структурированные признаковые представления для сегментации.
2
CLIP-Driven Universal Model сегментирует 25 органов и 6 типов опухолей, обучаясь на объединении 14 наборов данных (3 410 КТ-снимков).
3
Универсальная модель вычислительно более эффективна, работает примерно в 6 раз быстрее по сравнению со специфичными для набора данных моделями.
4
Модель лучше обобщается на КТ-снимки с разных сайтов и демонстрирует более сильные возможности трансферного обучения на новых задачах.
5
Обученная модель оценена на 6 162 внешних КТ-снимках из 3 наборов данных, заняла первое место в публичном рейтинге MSD и показала SOTA на BTCV.
Research Object
CLIP-управляемая универсальная модель для сегментации органов и обнаружения опухолей, применяемая к КТ-снимкам
Research Subject
Способность модели сегментировать 25 органов и обнаруживать 6 типов опухолей за счёт внедрения текстовых эмбеддингов CLIP для учёта анатомических связей, включая обобщаемость между датасетами/центрами, вычислительную эффективность и эффективность переноса обучения
Publication Details
Publication Date
2023-10-01
Journal
Publisher
ISSN
Cited by
312
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest