Оценка больших языковых моделей как вспомогательного инструмента для диагностики сложных медицинских случаев

Evaluation of large language models as a diagnostic aid for complex medical cases
Alexander T. Pearson, Lajos Pusztai, Alejandro Ríos-Hoyo, Frederick M. Howard, Naing Lin Shan, Anran Li
2024-06-20

GPT-4индекс сходства Жаккарасложные клинические случаидифференциальная диагностикабольшие языковые модели
Обоснование: В последнее время использование больших языковых моделей (LLM) приобрело популярность в различных областях, включая ответы на вопросы, задаваемые пациентами и медицинскими специалистами. Цель: Оценить эффективность и ограничения LLM при установлении правильного диагноза в сложном клиническом случае. Дизайн исследования: Из материалов Massachusetts General Hospital Case Records были отобраны 75 последовательных клинических случаев, для которых модели GPT-3.5 и GPT-4 компании OpenAI формировали дифференциальный диагноз. Результаты: Среднее число диагнозов, предложенных экспертами, обсуждавшими случаи в Massachusetts General Hospital, составило 16,77; модель GPT-3.5 предложила 30 диагнозов, а GPT-4 — 15,45 (p < 0,0001). GPT-4 чаще указывала правильный диагноз первым (22% против 20% для GPT-3.5; p = 0,86) и включала правильный диагноз в число трех наиболее вероятных (42% против 24%; p = 0,075). GPT-4 лучше предлагала правильный диагноз, когда диагнозы классифицировали по группам в соответствии с медицинской специальностью и учитывали наличие правильного диагноза на любой позиции в дифференциальном списке (68% против 48%; p = 0,0063). Дифференциальный список GPT-4 был более похож на список экспертов, обсуждавших случаи, чем список GPT-3.5 (индекс сходства Жаккара — 0,22 против 0,12; p = 0,001). Включение правильного диагноза в сформированный дифференциальный список коррелировало с числом статей в PubMed, соответствующих этому диагнозу (OR 1,40; 95% ДИ 1,25–1,56 для GPT-3.5; OR 1,25; 95% ДИ 1,13–1,40 для GPT-4), но не с распространенностью заболевания. Выводы и значимость: Модель GPT-4 смогла сформировать дифференциальный список, содержащий правильный диагноз, примерно в двух третях случаев, однако наиболее вероятный диагноз часто оказывался неправильным для обеих моделей. В текущем состоянии этот инструмент может использоваться главным образом как вспомогательное средство для расширения перечня возможных диагностических предположений по конкретному случаю. Необходимо обучать будущие LLM с учетом расхождения между распространенностью заболеваний и доступностью соответствующих сведений в научной литературе.
1
Включение правильного диагноза коррелировало с наличием соответствующих публикаций в PubMed, но не с распространённостью заболевания, что указывает на влияние доступности литературы.
2
GPT-4 формировал более короткие дифференциальные списки, чем GPT-3.5, и сильнее соответствовал спискам обсуждающих врачей MGH: индексы сходства Жаккара составили 0,22 против 0,12.
3
GPT-4 включал правильный диагноз в дифференциальный ряд в 68% случаев против 48% у GPT-3.5 при группировке диагнозов по медицинским специальностям.
4
Правильный диагноз занимал первое место лишь в 22% случаев у GPT-4 и 20% у GPT-3.5, что указывает на частую неспособность определить наиболее вероятный диагноз.
5
В настоящее время модели могут использоваться лишь для расширения диагностических соображений, но не как надёжные инструменты выбора основного диагноза.

Большие языковые модели GPT3.5 и GPT4, применённые к 75 сложным клиническим случаям из архивов историй болезни Massachusetts General Hospital

Диагностическая эффективность и ограничения, включая точность, ранжирование, состав и сходство сформированных дифференциальных диагнозов

Publication Details
Publication Date
2024-06-20
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Alexander T. Pearson
Lajos Pusztai
Alejandro Ríos-Hoyo
Frederick M. Howard
Naing Lin Shan
Anran Li
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat →
Make a presentation
100%