Большие языковые модели кодируют клинические знания
Large language models encode clinical knowledge
2023-07-12
SCID: 54.1/7fa75k75
Discuss with AI
HealthSearchQAMed-PaLMбенчмарк MultiMedQAнастройка инструкций с помощью промптовответы на медицинские вопросы
Figures from the paper
Abstract (AI)
Большие языковые модели (LLM) продемонстрировали впечатляющие возможности, однако требования к их применению в клинической практике высоки. Попытки оценить клинические знания моделей обычно основываются на автоматизированных оценках с использованием ограниченного числа эталонных наборов данных. Для устранения этих ограничений мы представляем MultiMedQA — эталонный набор, объединяющий шесть существующих наборов данных для ответов на медицинские вопросы, охватывающих профессиональную медицину, научные исследования и запросы потребителей, а также новый набор данных HealthSearchQA, содержащий медицинские вопросы, найденные в поисковых системах. Мы предлагаем систему оценки ответов моделей экспертами по нескольким направлениям, включая фактическую точность, понимание, рассуждение, потенциальный вред и предвзятость. Кроме того, мы оцениваем Pathways Language Model 1 (PaLM — большая языковая модель с 540 миллиардами параметров) и её вариант Flan-PaLM 2, дообученный с использованием инструкций, на наборе MultiMedQA. Сочетая различные стратегии формулирования запросов, Flan-PaLM достигает наилучшей на сегодняшний день точности на каждом наборе данных MultiMedQA с вопросами с несколькими вариантами ответа (MedQA 3, MedMCQA 4, PubMedQA 5 и клинические темы Measuring Massive Multitask Language Understanding (MMLU) 6), включая точность 67,6% на MedQA (вопросы в стиле экзамена на получение медицинской лицензии в США), превысив предыдущий лучший результат более чем на 17%. Однако оценка экспертами выявляет существенные пробелы. Для их устранения мы вводим настройку инструкционных подсказок — эффективный по числу параметров подход к адаптации LLM к новым предметным областям с использованием небольшого числа примеров. Полученная модель Med-PaLM демонстрирует обнадёживающие результаты, но всё ещё уступает врачам. Мы показываем, что понимание, воспроизведение знаний и рассуждение улучшаются с увеличением масштаба модели и при настройке инструкционных подсказок, что указывает на потенциальную полезность LLM в медицине. Оценки экспертами выявляют ограничения современных моделей и подчёркивают важность как систем оценки, так и разработки методов для создания безопасных и полезных LLM, предназначенных для клинического применения.
Key Findings
1
Flan-PaLM достиг наилучшей на момент исследования точности на всех оценённых многовариантных наборах MultiMedQA, включая 67,6% на MedQA, превысив предыдущий результат более чем на 17%.
2
Настройка промптов с инструкциями позволила создать Med-PaLM с многообещающими клиническими результатами, однако при оценке людьми он всё ещё уступал врачам.
3
Увеличение масштаба модели и настройка промптов улучшили понимание, воспроизведение знаний и рассуждение, но оценки выявили сохраняющиеся проблемы безопасности и надёжности.
4
Бенчмарк MultiMedQA объединяет шесть существующих наборов медицинских вопросов и новый набор HealthSearchQA, охватывающий профессиональные, исследовательские и потребительские запросы.
5
Предложенная система оценки людьми анализирует ответы моделей по фактичности, пониманию, рассуждению, потенциальному вреду и предвзятости, устраняя ограничения оценок только по автоматическим бенчмаркам.
Research Object
Большие языковые модели (LLM), оценённые на наборах задач по медицинскому вопросно-ответному обслуживанию (MultiMedQA и HealthSearchQA), включая PaLM, Flan-PaLM 2 и Med-PaLM
Research Subject
клинические знания, включая фактическую точность, понимание, рассуждение, воспроизведение знаний, потенциальный вред и предвзятость, а также влияние масштаба модели и настройки инструкционных подсказок
Publication Details
Publication Date
2023-07-12
Journal
Publisher
ISSN
Cited by
3807
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Работы, цитирующие эту статью6
Сравнение ответов врачей и чат-бота на основе искусственного интеллекта на вопросы пациентов, размещённые в публичном форуме в социальных сетях2023
ChatGPT и рост крупных языковых моделей: новая угроза инфодемии, вызванной ИИ, для общественного здоровья2023
Генерация с дополнением поиском для больших языковых моделей в здравоохранении: систематический обзор2025
RLHF расшифровано: критический анализ обучения с подкреплением на основе человеческой обратной связи для крупных языковых моделей2025
На пути к автономным агентам медицинского искусственного интеллекта2026
Внутренняя заслуга и внешнее обвинение: самоатрибуция в эффективности операций и цепочки поставок2025