Grounding DINO‑US‑SAM: сегментация нескольких органов на УЗИ по текстовому запросу с VLM, тонко настроенными с помощью LoRA

Grounding DINO-US-SAM: Text-Prompted Multiorgan Segmentation in Ultrasound With LoRA-Tuned Vision–Language Models
Hamza Rasaee, Taha Koleilat, Hassan Rivaz
2025-09-02

Grounding DINOLoRA (адаптация низкого ранга)SAM2сравнение с SOTA (UniverSeg, MedSAM, MedCLIP-segment anything model, BiomedParse, SAMUS)дообучение для ультразвуковой доменыобобщение на невидимые наборы данныхпубличные ультразвуковые наборы данных (молочная железа, щитовидная железа, печень, простата, почка, параспинальная мышца)текстово-инициированная многорганная сегментациясегментация ультразвуковых изображениймодель зрение-язык
Точная и обобщаемая сегментация объектов на ультразвуковых изображениях по-прежнему представляет собой серьезную проблему из‑за анатомической вариабельности, разнообразия протоколов визуализации и ограниченного объема аннотированных данных. В этом исследовании мы предлагаем управляемую подсказкой модель «зрение—язык» (VLM), которая интегрирует Grounding DINO с SAM2 для сегментации объектов в нескольких органах на УЗИ. Для работы использовались 18 публичных наборов данных по УЗИ, охватывающих молочную железу, щитовидную железу, печень, предстательную железу, почку и параспинальные мышцы. Эти наборы данных были разделены: 15 использованы для дообучения и валидации Grounding DINO с применением низкоранговой адаптации (LoRA) к домену ультразвука, а три полностью отложены для тестирования с целью оценки производительности на невидимых распределениях. Комплексные эксперименты показывают, что наш подход превосходит современные методы сегментации (SOTA), включая UniverSeg, MedSAM, MedCLIP–segment anything model (SAM), BiomedParse и SAMUS на большинстве «видимых» наборов данных, при этом сохраняя высокую производительность на «невидимых» наборах без дополнительного дообучения. Эти результаты подчеркивают перспективность VLM для масштабируемого и надежного анализа ультразвуковых изображений и снижения зависимости от больших органо-специфичных аннотированных наборов данных. Код будет опубликован на code.sonography.ai после принятия работы.
1
Модель зрение-язык с подсказками, объединяющая grounding DINO и SAM2, обеспечивает сегментацию объектов в разных органах на УЗИ.
2
Проведена оценка на 18 публичных УЗИ-наборах, охватывающих грудь, щитовидную железу, печень, простату, почки и парапозвоночные мышцы, с тремя отложенными набором для тестирования на невидимых данных.
3
Тонкая настройка grounding DINO методом низкоранговой адаптации (LoRA) на 15 УЗИ-наборах данных адаптирует модель к домену ультразвука.
4
Метод сохраняет высокую производительность на невидимых наборах данных без дополнительной дообучения, что указывает на хорошую обобщаемость между распределениями.
5
Предложенный подход превосходит методы SOTA сегментации (UniverSeg, MedSAM, MedCLIP-SAM, BiomedParse, SAMUS) на большинстве изученных наборов данных.
6
Исследование показывает, что VLM могут снизить зависимость от больших органо-специфичных аннотированных наборов данных для масштабируемого и устойчивого анализа УЗИ.

Система визуально-языковой модели с текстовыми подсказками (Grounding DINO, интегрированный с SAM2 и донастроенный методом LoRA) для сегментации мультиорганных ультразвуковых изображений

Точность и обобщаемость сегментации объектов в ультразвуковых изображениях для нескольких органов на известных и невидимых наборах данных (сравнение производительности с методами SOTA)

Publication Details
Publication Date
2025-09-02
Journal
Publisher
ISSN
Cited by
7
Access Type
Author Information
Authors
Hamza Rasaee
Taha Koleilat
Hassan Rivaz
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%