MedAgentBench: виртуальная среда электронной медицинской карты для тестирования медицинских агентов на основе больших языковых моделей

MedAgentBench: A Virtual EHR Environment to Benchmark Medical LLM Agents
Yixing Jiang, Kameron Collin Black, Gloria Geng, Dae-Gyun Park, James Zou, Andrew Y. Ng, Jonathan H. Chen
2025-08-14

среда, совместимая с FHIRMedAgentBenchориентированный на агентов бенчмаркэлектронные медицинские записимедицинские агенты на основе больших языковых моделей
ВВЕДЕНИЕ В последние годы большие языковые модели (LLM) продемонстрировали значительный прогресс, особенно в способности функционировать в качестве агентов, выходя за рамки своей традиционной роли чат-ботов. Эти агенты могут использовать возможности планирования и применения инструментов для решения задач, сформулированных на высоком уровне. Это открывает новые возможности для снижения нагрузки, связанной с административными задачами, и решения проблемы текущей нехватки медицинского персонала. Однако в настоящее время отсутствует стандартизированный набор данных для тестирования агентных возможностей LLM в медицинских приложениях, что затрудняет оценку их эффективности при выполнении сложных задач в интерактивных медицинских средах. МЕТОДЫ Для устранения этого пробела во внедрении агентного искусственного интеллекта (ИИ) в здравоохранении мы представляем MedAgentBench — широкий комплекс оценки, предназначенный для изучения агентных возможностей LLM в контексте медицинских записей. MedAgentBench включает 300 специфичных для пациентов клинически обоснованных задач из 10 категорий, составленных врачами, реалистичные профили 100 пациентов, содержащие более 700 000 элементов данных, интерактивную среду, соответствующую стандарту Fast Healthcare Interoperability Resources, а также сопутствующую кодовую базу. Среда использует стандартные интерфейсы прикладного программирования и инфраструктуру обмена данными, применяемые в современных системах электронных медицинских карт (EHR), благодаря чему ее можно легко перенести в действующие системы EHR. РЕЗУЛЬТАТЫ MedAgentBench представляет собой ненасыщенный агентно-ориентированный бенчмарк, на котором современные большие языковые модели демонстрируют определенную способность успешно выполнять задачи. Лучшая модель (Claude 3.5 Sonnet v2) достигает показателя успешности 69,67%. Однако возможности для улучшения остаются значительными, что задает сообществу четкое направление для дальнейшей оптимизации. Кроме того, эффективность существенно варьирует в зависимости от категории задач. ВЫВОДЫ Фреймворки и бенчмарки для агентных задач являются необходимым следующим шагом для развития потенциала и возможностей эффективного улучшения и интеграции...
1
Производительность LLM-агентов существенно различается между категориями задач, демонстрируя неравномерность их возможностей при работе с медицинскими EHR.
2
MedAgentBench представляет стандартизированный бенчмарк для оценки медицинских LLM-агентов на сложных интерактивных задачах в электронных медицинских картах.
3
MedAgentBench предоставляет интерактивную среду, совместимую с FHIR, использующую стандартные API и коммуникационную инфраструктуру EHR, что поддерживает возможную интеграцию с реальными системами.
4
Бенчмарк включает 300 созданных врачами задач для конкретных пациентов по 10 категориям, реалистичные профили 100 пациентов и более 700 000 элементов данных.
5
Бенчмарк остается недостаточно насыщенным: лучшая модель Claude 3.5 Sonnet v2 достигает показателя успешности 69,67%, что указывает на значительный потенциал улучшения.

Виртуальная интерактивная электронная медицинская карта MedAgentBench, совместимая с FHIR и содержащая реалистичные профили пациентов и клинически сформулированные задания

Способность медицинских агентов на основе LLM решать задачи и их эффективность в интерактивной среде EHR, включая различия между категориями задач

Publication Details
Publication Date
2025-08-14
Journal
Publisher
ISSN
Cited by
55
Access Type
Author Information
Authors
Yixing Jiang
Kameron Collin Black
Gloria Geng
Dae-Gyun Park
James Zou
Andrew Y. Ng
Jonathan H. Chen
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%