Система оценки больших языковых моделей в здравоохранении с участием человека, разработанная на основе обзора литературы

A framework for human evaluation of large language models in healthcare derived from literature review
Yanshan Wang, Yifan Peng, Sonish Sivarajkumar, Xizhi Wu, Shyam Visweswaran, Giovanni Cacciamani, Piyush Mathur, Sunyang Fu, Thomas Yu Chow Tam, Sumit Kapoor, Alisa V Stolyar, Katelyn Polanska, Karleigh R McCarthy, Hunter Osterhoudt, Cong Sun
2024-09-27

фреймворк QUESTздравоохранениеоценка человекомбольшие языковые моделиобзор литературы
По мере того как генеративный искусственный интеллект (GenAI), в частности большие языковые модели (LLM), продолжает внедряться в здравоохранение, оценка LLM с участием человека становится необходимой для обеспечения безопасности и эффективности. В настоящем исследовании представлен обзор существующей литературы по методологиям оценки LLM с участием человека в здравоохранении в различных медицинских специальностях; рассмотрены такие факторы, как оцениваемые параметры, типы и объемы выборок, отбор и привлечение оценщиков, системы и метрики, процесс оценки, а также тип статистического анализа. Обзор 142 исследований выявил недостатки современных практик оценки с участием человека с точки зрения надежности, обобщаемости и применимости. Для преодоления столь существенных препятствий, связанных с разработкой и внедрением LLM в здравоохранении, мы предлагаем QUEST — комплексную и практичную систему оценки LLM с участием человека, охватывающую три этапа рабочего процесса: планирование; реализацию и экспертное рассмотрение; подсчет баллов и анализ результатов. QUEST разработана на основе пяти предлагаемых принципов оценки: качество информации; понимание и рассуждение; стиль выражения и персона; безопасность и вред; доверие и уверенность.
1
Обзор 142 исследований медицинских больших языковых моделей выявляет пробелы в надёжности, обобщаемости и применимости существующих практик оценки с участием людей.
2
QUEST определяет пять принципов оценки: качество информации, понимание и рассуждение, стиль выражения и персона, безопасность и вред, а также доверие и уверенность.
3
Авторы предлагают комплексную рамку QUEST, организующую оценку медицинских больших языковых моделей в три этапа: планирование; реализация и экспертное разрешение разногласий; оценивание и обзор.
4
В обзоре систематически охарактеризованы измеряемые аспекты, выборка и набор оценщиков, используемые рамки и метрики, процедуры и статистический анализ в различных медицинских специальностях.

большие языковые модели в здравоохранении

методологии, практики и принципы оценки людьми качества, рассуждений, коммуникации, безопасности и надёжности больших языковых моделей в здравоохранении

Publication Details
Publication Date
2024-09-27
Journal
Publisher
ISSN
Cited by
370
Access Type
Author Information
Authors
Yanshan Wang
Yifan Peng
Sonish Sivarajkumar
Xizhi Wu
Shyam Visweswaran
Giovanni Cacciamani
Piyush Mathur
Sunyang Fu
Thomas Yu Chow Tam
Sumit Kapoor
Alisa V Stolyar
Katelyn Polanska
Karleigh R McCarthy
Hunter Osterhoudt
Cong Sun
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat →
Make a presentation
100%