Система оценки больших языковых моделей в здравоохранении с участием человека, разработанная на основе обзора литературы
A framework for human evaluation of large language models in healthcare derived from literature review
2024-09-27
SCID: 54.1/7tcx77s3
Discuss with AI
фреймворк QUESTздравоохранениеоценка человекомбольшие языковые моделиобзор литературы
Figures from the paper
Abstract (AI)
По мере того как генеративный искусственный интеллект (GenAI), в частности большие языковые модели (LLM), продолжает внедряться в здравоохранение, оценка LLM с участием человека становится необходимой для обеспечения безопасности и эффективности. В настоящем исследовании представлен обзор существующей литературы по методологиям оценки LLM с участием человека в здравоохранении в различных медицинских специальностях; рассмотрены такие факторы, как оцениваемые параметры, типы и объемы выборок, отбор и привлечение оценщиков, системы и метрики, процесс оценки, а также тип статистического анализа. Обзор 142 исследований выявил недостатки современных практик оценки с участием человека с точки зрения надежности, обобщаемости и применимости. Для преодоления столь существенных препятствий, связанных с разработкой и внедрением LLM в здравоохранении, мы предлагаем QUEST — комплексную и практичную систему оценки LLM с участием человека, охватывающую три этапа рабочего процесса: планирование; реализацию и экспертное рассмотрение; подсчет баллов и анализ результатов. QUEST разработана на основе пяти предлагаемых принципов оценки: качество информации; понимание и рассуждение; стиль выражения и персона; безопасность и вред; доверие и уверенность.
Key Findings
1
Обзор 142 исследований медицинских больших языковых моделей выявляет пробелы в надёжности, обобщаемости и применимости существующих практик оценки с участием людей.
2
QUEST определяет пять принципов оценки: качество информации, понимание и рассуждение, стиль выражения и персона, безопасность и вред, а также доверие и уверенность.
3
Авторы предлагают комплексную рамку QUEST, организующую оценку медицинских больших языковых моделей в три этапа: планирование; реализация и экспертное разрешение разногласий; оценивание и обзор.
4
В обзоре систематически охарактеризованы измеряемые аспекты, выборка и набор оценщиков, используемые рамки и метрики, процедуры и статистический анализ в различных медицинских специальностях.
Research Object
большие языковые модели в здравоохранении
Research Subject
методологии, практики и принципы оценки людьми качества, рассуждений, коммуникации, безопасности и надёжности больших языковых моделей в здравоохранении
Publication Details
Publication Date
2024-09-27
Journal
Publisher
ISSN
Cited by
370
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai4
Обучение языковых моделей следованию инструкциям с использованием обратной связи от человека2022
Большие языковые модели кодируют клинические знания2023
Сравнение ответов врачей и чат-бота на основе искусственного интеллекта на вопросы пациентов, размещённые в публичном форуме в социальных сетях2023
Как ChatGPT показывает себя на экзамене для получения медицинской лицензии в США (USMLE)? Последствия использования крупных языковых моделей для медицинского образования и оценки знаний2023