Платформа для оценки клинической безопасности и частоты галлюцинаций больших языковых моделей при суммировании медицинских текстов

A framework to assess clinical safety and hallucination rates of LLMs for medical text summarisation
Elham Asgari, Nina Montaña-Brown, Magda Dubois, Saleh Khalil, Jasmine Balloch, Joshua Au Yeung, Dominic Pimenta
2025-05-13

генерация клинических записейклиническая безопасностьтаксономия ошибокчастота галлюцинацийсуммаризация медицинских текстов
Интеграция больших языковых моделей (LLM) в здравоохранение может повысить эффективность рабочих процессов и улучшить медицинскую помощь пациентам за счёт автоматизации таких задач, как суммирование консультаций. Однако соответствие результатов работы LLM исходной достоверной информации имеет решающее значение для предотвращения недопонимания, которое может поставить под угрозу безопасность пациентов. Мы предлагаем платформу, включающую (1) таксономию ошибок для классификации результатов работы LLM, (2) экспериментальную структуру для итеративных сравнений в нашем конвейере генерации документов с использованием LLM, (3) систему оценки клинической безопасности для определения вреда, обусловленного ошибками, и (4) графический пользовательский интерфейс CREOLA, облегчающий выполнение этих процессов. Показатели клинических ошибок были рассчитаны на основе 18 экспериментальных конфигураций с использованием LLM для генерации клинических записей, включавших 12 999 предложений, размеченных медицинскими специалистами. Мы выявили частоту галлюцинаций 1,47% и частоту пропусков 3,45%. Благодаря совершенствованию промптов и рабочих процессов нам удалось снизить частоту серьёзных ошибок ниже ранее опубликованных показателей, характерных для ведения записей медицинскими специалистами, что подчёркивает потенциал платформы для повышения безопасности клинической документации.
1
Метрики клинических ошибок были получены на основе 18 конфигураций генерации клинических записей LLM, включавших 12 999 предложений, размеченных клиницистами.
2
Уточнение промптов и рабочих процессов снизило частоту серьёзных ошибок ниже ранее опубликованных показателей для записей, составленных людьми.
3
В исследованных системах частота галлюцинаций составила 1,47%, а частота пропусков — 3,45%.
4
Фреймворк поддерживает систематическое выявление и снижение ошибок LLM для повышения безопасности автоматизированного ведения клинической документации.
5
В работе представлен фреймворк для оценки безопасности клинического суммирования с помощью LLM, объединяющий таксономию ошибок, итеративные эксперименты, оценку клинического вреда и интерфейс CREOLA.

медицинское резюмирование текста и создание клинических записей с помощью больших языковых моделей (LLM)

клиническая безопасность, частота галлюцинаций, пропусков и ошибок в клинической документации, создаваемой LLM

Publication Details
Publication Date
2025-05-13
Journal
Publisher
ISSN
Cited by
341
Access Type
Author Information
Authors
Elham Asgari
Nina Montaña-Brown
Magda Dubois
Saleh Khalil
Jasmine Balloch
Joshua Au Yeung
Dominic Pimenta
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat →
Make a presentation
100%