Большие языковые модели кодируют клинические знания

Large language models encode clinical knowledge
Greg S. Corrado, Aakanksha Chowdhery, Nenad Tomašev, Tao Tu, Jason Lee, S. Sara Mahdavi, Dina Demner‐Fushman, Juraj Gottweis, Stephen Pfohl, Heather Cole-Lewis, P. Mansfield, Blaise Agüera y Arcas, Yun Liu, Christopher Semturs, Joëlle Barral, Dale R. Webster, Yossi Matias, Shekoofeh Azizi, Vivek Natarajan, Alan Karthikesalingam, Martin Seneviratne, Karan Singhal, Hyung Won Chung, Nathan Scales, Ajay Kumar Tanwani, Perry W. Payne, Paul Gamble, Christopher Kelly, Abubakr Babiker, Nathanael Schärli, Katherine Chou, Alvin Rajkomar
2023-07-12

HealthSearchQAMed-PaLMбенчмарк MultiMedQAнастройка инструкций с помощью промптовответы на медицинские вопросы
Большие языковые модели (LLM) продемонстрировали впечатляющие возможности, однако требования к их применению в клинической практике высоки. Попытки оценить клинические знания моделей обычно основываются на автоматизированных оценках с использованием ограниченного числа эталонных наборов данных. Для устранения этих ограничений мы представляем MultiMedQA — эталонный набор, объединяющий шесть существующих наборов данных для ответов на медицинские вопросы, охватывающих профессиональную медицину, научные исследования и запросы потребителей, а также новый набор данных HealthSearchQA, содержащий медицинские вопросы, найденные в поисковых системах. Мы предлагаем систему оценки ответов моделей экспертами по нескольким направлениям, включая фактическую точность, понимание, рассуждение, потенциальный вред и предвзятость. Кроме того, мы оцениваем Pathways Language Model 1 (PaLM — большая языковая модель с 540 миллиардами параметров) и её вариант Flan-PaLM 2, дообученный с использованием инструкций, на наборе MultiMedQA. Сочетая различные стратегии формулирования запросов, Flan-PaLM достигает наилучшей на сегодняшний день точности на каждом наборе данных MultiMedQA с вопросами с несколькими вариантами ответа (MedQA 3, MedMCQA 4, PubMedQA 5 и клинические темы Measuring Massive Multitask Language Understanding (MMLU) 6), включая точность 67,6% на MedQA (вопросы в стиле экзамена на получение медицинской лицензии в США), превысив предыдущий лучший результат более чем на 17%. Однако оценка экспертами выявляет существенные пробелы. Для их устранения мы вводим настройку инструкционных подсказок — эффективный по числу параметров подход к адаптации LLM к новым предметным областям с использованием небольшого числа примеров. Полученная модель Med-PaLM демонстрирует обнадёживающие результаты, но всё ещё уступает врачам. Мы показываем, что понимание, воспроизведение знаний и рассуждение улучшаются с увеличением масштаба модели и при настройке инструкционных подсказок, что указывает на потенциальную полезность LLM в медицине. Оценки экспертами выявляют ограничения современных моделей и подчёркивают важность как систем оценки, так и разработки методов для создания безопасных и полезных LLM, предназначенных для клинического применения.
1
Flan-PaLM достиг наилучшей на момент исследования точности на всех оценённых многовариантных наборах MultiMedQA, включая 67,6% на MedQA, превысив предыдущий результат более чем на 17%.
2
Настройка промптов с инструкциями позволила создать Med-PaLM с многообещающими клиническими результатами, однако при оценке людьми он всё ещё уступал врачам.
3
Увеличение масштаба модели и настройка промптов улучшили понимание, воспроизведение знаний и рассуждение, но оценки выявили сохраняющиеся проблемы безопасности и надёжности.
4
Бенчмарк MultiMedQA объединяет шесть существующих наборов медицинских вопросов и новый набор HealthSearchQA, охватывающий профессиональные, исследовательские и потребительские запросы.
5
Предложенная система оценки людьми анализирует ответы моделей по фактичности, пониманию, рассуждению, потенциальному вреду и предвзятости, устраняя ограничения оценок только по автоматическим бенчмаркам.

Большие языковые модели (LLM), оценённые на наборах задач по медицинскому вопросно-ответному обслуживанию (MultiMedQA и HealthSearchQA), включая PaLM, Flan-PaLM 2 и Med-PaLM

клинические знания, включая фактическую точность, понимание, рассуждение, воспроизведение знаний, потенциальный вред и предвзятость, а также влияние масштаба модели и настройки инструкционных подсказок

Publication Details
Publication Date
2023-07-12
Journal
Publisher
ISSN
Cited by
3807
Access Type
Author Information
Authors
Greg S. Corrado
Aakanksha Chowdhery
Nenad Tomašev
Tao Tu
Jason Lee
S. Sara Mahdavi
Dina Demner‐Fushman
Juraj Gottweis
Stephen Pfohl
Heather Cole-Lewis
P. Mansfield
Blaise Agüera y Arcas
Yun Liu
Christopher Semturs
Joëlle Barral
Dale R. Webster
Yossi Matias
Shekoofeh Azizi
Vivek Natarajan
Alan Karthikesalingam
Martin Seneviratne
Karan Singhal
Hyung Won Chung
Nathan Scales
Ajay Kumar Tanwani
Perry W. Payne
Paul Gamble
Christopher Kelly
Abubakr Babiker
Nathanael Schärli
Katherine Chou
Alvin Rajkomar
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%