Модель «зрение‑язык» для генерации медицинских отчётов и визуального ответа на вопросы: обзор

Vision-language models for medical report generation and visual question answering: a review
Iryna Hartsock, Ghulam Rasool
2024-11-19

архитектуры на базе трансформеровгенерация медицинских отчетовмедицинские модели Vision-Languageпубличные медицинские датасеты Vision-Languageвизуальный ответ на вопросы (VQA)
Медицинские модели «зрение‑язык» (VLM) объединяют компьютерное зрение (CV) и обработку естественного языка (NLP) для анализа визуальных и текстовых медицинских данных. В данной работе приведён обзор последних достижений в разработке VLM, специализированных для здравоохранения, с акцентом на общедоступные модели, предназначенные для генерации медицинских отчётов и визуального ответа на вопросы (VQA). Мы даём введение в NLP и CV, объясняя, как методы из обеих областей интегрируются в VLM, при этом визуальные и языковые данные часто объединяются с использованием архитектур на основе Transformer для эффективного обучения на мультимодальных данных. Основные рассматриваемые направления включают исследование 18 публичных медицинских датасетов «зрение‑язык», подробный анализ архитектур и стратегий предварительного обучения 16 недавних значительных медицинских VLM и всестороннее обсуждение метрик оценки эффективности VLM для генерации медицинских отчётов и VQA. Мы также выделяем текущие проблемы разработки медицинских VLM, включая ограниченную доступность данных, вопросы конфиденциальности данных и отсутствие адекватных метрик оценки, а также предлагаем направления для преодоления этих препятствий. В целом обзор суммирует недавний прогресс в разработке VLM для использования мультимодальных медицинских данных с целью улучшения приложений в здравоохранении.
1
Комплексно обсуждаются метрики оценки для генерации медицинских отчетов и VQA с акцентом на недостаточность текущих метрик.
2
Выявлены ключевые проблемы: ограниченная доступность данных, вопросы конфиденциальности данных и отсутствие надлежащих метрик оценки для медицинских VLM.
3
Медицинские визуально-языковые модели (VLM) объединяют компьютерное зрение и NLP, обычно объединяя визуальные и текстовые данные с помощью архитектур на основе Transformer.
4
Статья анализирует архитектуры и стратегии предобучения 16 недавних заметных медицинских VLM.
5
Обзор включает каталог из 18 публично доступных медицинских визуально-языковых наборов данных, релевантных для генерации отчетов и визуального ответов на вопросы.
6
Обзор предлагает направления для будущих исследований с целью преодоления препятствий в разработке медицинских VLM для более эффективного использования мультимодальных медицинских данных в здравоохранении.

Медицинские модели «видение-язык» (VLM) для медицинских приложений

Разработка, архитектуры, стратегии предобучения, наборы данных, метрики оценки и производительность VLM для генерации медицинских отчётов и визуального ответа на вопросы (VQA)

Publication Details
Publication Date
2024-11-19
Journal
Publisher
ISSN
Cited by
212
Access Type
Author Information
Authors
Iryna Hartsock
Ghulam Rasool
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%