Платформа для оценки клинической безопасности и частоты галлюцинаций больших языковых моделей при суммировании медицинских текстов
A framework to assess clinical safety and hallucination rates of LLMs for medical text summarisation
2025-05-13
SCID: 54.1/yd3ty9jn
Discuss with AI
генерация клинических записейклиническая безопасностьтаксономия ошибокчастота галлюцинацийсуммаризация медицинских текстов
Figures from the paper
Abstract (AI)
Интеграция больших языковых моделей (LLM) в здравоохранение может повысить эффективность рабочих процессов и улучшить медицинскую помощь пациентам за счёт автоматизации таких задач, как суммирование консультаций. Однако соответствие результатов работы LLM исходной достоверной информации имеет решающее значение для предотвращения недопонимания, которое может поставить под угрозу безопасность пациентов. Мы предлагаем платформу, включающую (1) таксономию ошибок для классификации результатов работы LLM, (2) экспериментальную структуру для итеративных сравнений в нашем конвейере генерации документов с использованием LLM, (3) систему оценки клинической безопасности для определения вреда, обусловленного ошибками, и (4) графический пользовательский интерфейс CREOLA, облегчающий выполнение этих процессов. Показатели клинических ошибок были рассчитаны на основе 18 экспериментальных конфигураций с использованием LLM для генерации клинических записей, включавших 12 999 предложений, размеченных медицинскими специалистами. Мы выявили частоту галлюцинаций 1,47% и частоту пропусков 3,45%. Благодаря совершенствованию промптов и рабочих процессов нам удалось снизить частоту серьёзных ошибок ниже ранее опубликованных показателей, характерных для ведения записей медицинскими специалистами, что подчёркивает потенциал платформы для повышения безопасности клинической документации.
Key Findings
1
Метрики клинических ошибок были получены на основе 18 конфигураций генерации клинических записей LLM, включавших 12 999 предложений, размеченных клиницистами.
2
Уточнение промптов и рабочих процессов снизило частоту серьёзных ошибок ниже ранее опубликованных показателей для записей, составленных людьми.
3
В исследованных системах частота галлюцинаций составила 1,47%, а частота пропусков — 3,45%.
4
Фреймворк поддерживает систематическое выявление и снижение ошибок LLM для повышения безопасности автоматизированного ведения клинической документации.
5
В работе представлен фреймворк для оценки безопасности клинического суммирования с помощью LLM, объединяющий таксономию ошибок, итеративные эксперименты, оценку клинического вреда и интерфейс CREOLA.
Research Object
медицинское резюмирование текста и создание клинических записей с помощью больших языковых моделей (LLM)
Research Subject
клиническая безопасность, частота галлюцинаций, пропусков и ошибок в клинической документации, создаваемой LLM
Publication Details
Publication Date
2025-05-13
Journal
Publisher
ISSN
Cited by
341
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest