Оценка больших языковых моделей как агентов в клинической практике
Evaluating large language models as agents in the clinic
2024-04-03
SCID: 54.1/z9rhdpud
Discuss with AI
структурированные клинические экзамены по искусственному интеллектуагенты на основе LLMподдержка принятия клинических решенийоценка клинических рабочих процессовбольшие языковые модели
Figures from the paper
Abstract (AI)
Недавние достижения в области больших языковых моделей (LLM) открыли новые возможности для здравоохранения — от синтеза информации до поддержки принятия клинических решений. Эти LLM способны не только моделировать язык, но и действовать как интеллектуальные «агенты», взаимодействующие с заинтересованными сторонами в рамках открытых диалогов и даже влияющие на принятие клинических решений. Вместо опоры на бенчмарки, оценивающие способность модели обрабатывать клинические данные или отвечать на стандартизированные тестовые вопросы, LLM-агентов можно моделировать в высокоточных симуляциях клинических условий и оценивать по их влиянию на клинические рабочие процессы. Такие оценочные frameworks, которые мы называем «структурированными клиническими экзаменами по искусственному интеллекту» («AI-SCE»), могут опираться на сопоставимые технологии, в которых машины функционируют с различной степенью автономности, например беспилотные автомобили, в динамичных средах с участием множества заинтересованных сторон. Разработка надежных клинических оценок, отражающих реальные условия, будет иметь решающее значение для внедрения LLM-агентов в медицинскую практику.
Key Findings
1
Фреймворки AI-SCE должны оценивать агентов в динамичных средах с несколькими участниками, используя идеи из оценки автономных автомобилей.
2
Традиционные тесты, оценивающие обработку клинических данных или ответы на стандартизированные вопросы, могут недостаточно отражать влияние LLM-агентов на реальные клинические рабочие процессы.
3
Большие языковые модели могут функционировать как интеллектуальные клинические агенты, взаимодействуя с участниками через открытые диалоги и потенциально влияя на принятие клинических решений.
4
Надёжные оценки в реалистичных клинических условиях необходимы до внедрения LLM-агентов в медицинскую практику.
5
Предлагаются структурированные экзамены для искусственного интеллекта в клинике (AI-SCE), использующие высокореалистичные симуляции клинических ситуаций для оценки работы агентов и их влияния.
Research Object
агенты на основе больших языковых моделей в клинических условиях
Research Subject
их влияние на клинические рабочие процессы и разработка высокореалистичных оценочных рамок для внедрения в медицинских условиях
Publication Details
Publication Date
2024-04-03
Journal
Publisher
ISSN
Cited by
139
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest