Оценка больших языковых моделей как вспомогательного инструмента для диагностики сложных медицинских случаев
Evaluation of large language models as a diagnostic aid for complex medical cases
2024-06-20
SCID: 54.1/9wzyb6qm
Discuss with AI
GPT-4индекс сходства Жаккарасложные клинические случаидифференциальная диагностикабольшие языковые модели
Figures from the paper
Abstract (AI)
Обоснование: В последнее время использование больших языковых моделей (LLM) приобрело популярность в различных областях, включая ответы на вопросы, задаваемые пациентами и медицинскими специалистами. Цель: Оценить эффективность и ограничения LLM при установлении правильного диагноза в сложном клиническом случае. Дизайн исследования: Из материалов Massachusetts General Hospital Case Records были отобраны 75 последовательных клинических случаев, для которых модели GPT-3.5 и GPT-4 компании OpenAI формировали дифференциальный диагноз. Результаты: Среднее число диагнозов, предложенных экспертами, обсуждавшими случаи в Massachusetts General Hospital, составило 16,77; модель GPT-3.5 предложила 30 диагнозов, а GPT-4 — 15,45 (p < 0,0001). GPT-4 чаще указывала правильный диагноз первым (22% против 20% для GPT-3.5; p = 0,86) и включала правильный диагноз в число трех наиболее вероятных (42% против 24%; p = 0,075). GPT-4 лучше предлагала правильный диагноз, когда диагнозы классифицировали по группам в соответствии с медицинской специальностью и учитывали наличие правильного диагноза на любой позиции в дифференциальном списке (68% против 48%; p = 0,0063). Дифференциальный список GPT-4 был более похож на список экспертов, обсуждавших случаи, чем список GPT-3.5 (индекс сходства Жаккара — 0,22 против 0,12; p = 0,001). Включение правильного диагноза в сформированный дифференциальный список коррелировало с числом статей в PubMed, соответствующих этому диагнозу (OR 1,40; 95% ДИ 1,25–1,56 для GPT-3.5; OR 1,25; 95% ДИ 1,13–1,40 для GPT-4), но не с распространенностью заболевания. Выводы и значимость: Модель GPT-4 смогла сформировать дифференциальный список, содержащий правильный диагноз, примерно в двух третях случаев, однако наиболее вероятный диагноз часто оказывался неправильным для обеих моделей. В текущем состоянии этот инструмент может использоваться главным образом как вспомогательное средство для расширения перечня возможных диагностических предположений по конкретному случаю. Необходимо обучать будущие LLM с учетом расхождения между распространенностью заболеваний и доступностью соответствующих сведений в научной литературе.
Key Findings
1
Включение правильного диагноза коррелировало с наличием соответствующих публикаций в PubMed, но не с распространённостью заболевания, что указывает на влияние доступности литературы.
2
GPT-4 формировал более короткие дифференциальные списки, чем GPT-3.5, и сильнее соответствовал спискам обсуждающих врачей MGH: индексы сходства Жаккара составили 0,22 против 0,12.
3
GPT-4 включал правильный диагноз в дифференциальный ряд в 68% случаев против 48% у GPT-3.5 при группировке диагнозов по медицинским специальностям.
4
Правильный диагноз занимал первое место лишь в 22% случаев у GPT-4 и 20% у GPT-3.5, что указывает на частую неспособность определить наиболее вероятный диагноз.
5
В настоящее время модели могут использоваться лишь для расширения диагностических соображений, но не как надёжные инструменты выбора основного диагноза.
Research Object
Большие языковые модели GPT3.5 и GPT4, применённые к 75 сложным клиническим случаям из архивов историй болезни Massachusetts General Hospital
Research Subject
Диагностическая эффективность и ограничения, включая точность, ранжирование, состав и сходство сформированных дифференциальных диагнозов
Publication Details
Publication Date
2024-06-20
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest