Оценка больших языковых моделей как агентов в клинической практике

Evaluating large language models as agents in the clinic
Atul J. Butte, Madhumita Sushil, Brenda Y. Miao, Nikita Mehandru, Eduardo Rodriguez Almaraz, Ahmed M. Alaa
2024-04-03

структурированные клинические экзамены по искусственному интеллектуагенты на основе LLMподдержка принятия клинических решенийоценка клинических рабочих процессовбольшие языковые модели
Недавние достижения в области больших языковых моделей (LLM) открыли новые возможности для здравоохранения — от синтеза информации до поддержки принятия клинических решений. Эти LLM способны не только моделировать язык, но и действовать как интеллектуальные «агенты», взаимодействующие с заинтересованными сторонами в рамках открытых диалогов и даже влияющие на принятие клинических решений. Вместо опоры на бенчмарки, оценивающие способность модели обрабатывать клинические данные или отвечать на стандартизированные тестовые вопросы, LLM-агентов можно моделировать в высокоточных симуляциях клинических условий и оценивать по их влиянию на клинические рабочие процессы. Такие оценочные frameworks, которые мы называем «структурированными клиническими экзаменами по искусственному интеллекту» («AI-SCE»), могут опираться на сопоставимые технологии, в которых машины функционируют с различной степенью автономности, например беспилотные автомобили, в динамичных средах с участием множества заинтересованных сторон. Разработка надежных клинических оценок, отражающих реальные условия, будет иметь решающее значение для внедрения LLM-агентов в медицинскую практику.
1
Фреймворки AI-SCE должны оценивать агентов в динамичных средах с несколькими участниками, используя идеи из оценки автономных автомобилей.
2
Традиционные тесты, оценивающие обработку клинических данных или ответы на стандартизированные вопросы, могут недостаточно отражать влияние LLM-агентов на реальные клинические рабочие процессы.
3
Большие языковые модели могут функционировать как интеллектуальные клинические агенты, взаимодействуя с участниками через открытые диалоги и потенциально влияя на принятие клинических решений.
4
Надёжные оценки в реалистичных клинических условиях необходимы до внедрения LLM-агентов в медицинскую практику.
5
Предлагаются структурированные экзамены для искусственного интеллекта в клинике (AI-SCE), использующие высокореалистичные симуляции клинических ситуаций для оценки работы агентов и их влияния.

агенты на основе больших языковых моделей в клинических условиях

их влияние на клинические рабочие процессы и разработка высокореалистичных оценочных рамок для внедрения в медицинских условиях

Publication Details
Publication Date
2024-04-03
Journal
Publisher
ISSN
Cited by
139
Access Type
Author Information
Authors
Atul J. Butte
Madhumita Sushil
Brenda Y. Miao
Nikita Mehandru
Eduardo Rodriguez Almaraz
Ahmed M. Alaa
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%