Базовые метрики для оценки эффективности медицинских диалогов на основе генеративного искусственного интеллекта

Foundation metrics for evaluating effectiveness of healthcare conversations powered by generative AI
Li-Jia Li, Olivier Gevaert, Yanshan Wang, Zhongqi Yang, Elahe Khatibi, Mahyar Abbasian, Iman Azimi, Ramesh Jain, David Oniani, Zahra Shakeri Hossein Abad, Alexander Thieme, Ram D. Sriram, Bryant Lin, Amir M. Rahmani
2024-03-29

оценка разговорных моделейгенеративный искусственный интеллектмедицинские чат-ботыметрики больших языковых моделейориентированная на пациента оценка
Генеративный искусственный интеллект призван революционизировать оказание медицинской помощи, преобразовав традиционный уход за пациентами в более персонализированный, эффективный и проактивный процесс. Чат-боты, функционирующие как интерактивные разговорные модели, вероятно, будут способствовать этой ориентированной на пациента трансформации здравоохранения. Предоставляя различные услуги, включая диагностику, персонализированные рекомендации по образу жизни, динамическое планирование последующих приемов и психологическую поддержку, они призваны существенно улучшить показатели здоровья пациентов и одновременно снизить нагрузку на медицинских работников. Жизненно важный характер применения таких систем в здравоохранении требует создания унифицированного и всеобъемлющего набора метрик для оценки разговорных моделей. Существующие метрики оценки, предложенные для различных универсальных больших языковых моделей (LLM), демонстрируют недостаточное понимание медицинских концепций и концепций здоровья, а также их значения для улучшения благополучия пациентов. Кроме того, эти метрики не учитывают ключевые ориентированные на пользователя аспекты, включая формирование доверия, этику, персонализацию, эмпатию, понимание информации пользователем и эмоциональную поддержку. Цель настоящей статьи — рассмотреть современные метрики оценки на основе больших языковых моделей, специально применимые для оценки интерактивных разговорных моделей в здравоохранении. Далее мы представляем всеобъемлющий набор метрик оценки, предназначенный для всестороннего анализа эффективности медицинских чат-ботов с точки зрения конечного пользователя. Эти метрики охватывают оценку способностей к обработке языка, влияния на реальные клинические задачи и эффективности интерактивного общения с пользователями. Наконец, мы обсуждаем проблемы, связанные с определением и внедрением этих метрик, уделяя особое внимание смешивающим факторам, таким как целевая аудитория, методы оценки и техники составления промптов, используемые в процессе оценки.
1
Текущие метрики игнорируют важные пользовательские аспекты медицинских чат-ботов, включая доверие, этику, персонализацию, эмпатию, понимание и эмоциональную поддержку.
2
Существующие метрики оценки LLM недостаточно учитывают медицинские концепции и их значение для благополучия пациентов в медицинских диалогах.
3
Реализация метрик для медицинских диалогов осложняется влиянием целевой аудитории, методов оценки и способов формулирования запросов.
4
Система предназначена для унифицированной оценки медицинских чат-ботов при выполнении таких функций, как диагностика, рекомендации по образу жизни, планирование последующих консультаций и поддержка психического здоровья.
5
В статье предложена комплексная ориентированная на конечного пользователя система метрик, охватывающая языковые способности, влияние на реальные клинические задачи и эффективность интерактивного общения.

медицинские чат-боты на основе больших языковых моделей (LLM) и их интерактивные разговорные модели

комплексные ориентированные на конечного пользователя метрики оценки их способностей к обработке языка, влияния на выполнение клинических задач и эффективности медицинских разговоров, включая доверие, этичность, персонализацию, эмпатию, понятность и эмоциональную поддержку

Publication Details
Publication Date
2024-03-29
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Li-Jia Li
Olivier Gevaert
Yanshan Wang
Zhongqi Yang
Elahe Khatibi
Mahyar Abbasian
Iman Azimi
Ramesh Jain
David Oniani
Zahra Shakeri Hossein Abad
Alexander Thieme
Ram D. Sriram
Bryant Lin
Amir M. Rahmani
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat →
Make a presentation
100%