MedAgentBench: виртуальная среда электронной медицинской карты для тестирования медицинских агентов на основе больших языковых моделей
MedAgentBench: A Virtual EHR Environment to Benchmark Medical LLM Agents
2025-08-14
SCID: 54.1/99fesyjh
Discuss with AI
среда, совместимая с FHIRMedAgentBenchориентированный на агентов бенчмаркэлектронные медицинские записимедицинские агенты на основе больших языковых моделей
Figures from the paper
Abstract (AI)
ВВЕДЕНИЕ В последние годы большие языковые модели (LLM) продемонстрировали значительный прогресс, особенно в способности функционировать в качестве агентов, выходя за рамки своей традиционной роли чат-ботов. Эти агенты могут использовать возможности планирования и применения инструментов для решения задач, сформулированных на высоком уровне. Это открывает новые возможности для снижения нагрузки, связанной с административными задачами, и решения проблемы текущей нехватки медицинского персонала. Однако в настоящее время отсутствует стандартизированный набор данных для тестирования агентных возможностей LLM в медицинских приложениях, что затрудняет оценку их эффективности при выполнении сложных задач в интерактивных медицинских средах. МЕТОДЫ Для устранения этого пробела во внедрении агентного искусственного интеллекта (ИИ) в здравоохранении мы представляем MedAgentBench — широкий комплекс оценки, предназначенный для изучения агентных возможностей LLM в контексте медицинских записей. MedAgentBench включает 300 специфичных для пациентов клинически обоснованных задач из 10 категорий, составленных врачами, реалистичные профили 100 пациентов, содержащие более 700 000 элементов данных, интерактивную среду, соответствующую стандарту Fast Healthcare Interoperability Resources, а также сопутствующую кодовую базу. Среда использует стандартные интерфейсы прикладного программирования и инфраструктуру обмена данными, применяемые в современных системах электронных медицинских карт (EHR), благодаря чему ее можно легко перенести в действующие системы EHR. РЕЗУЛЬТАТЫ MedAgentBench представляет собой ненасыщенный агентно-ориентированный бенчмарк, на котором современные большие языковые модели демонстрируют определенную способность успешно выполнять задачи. Лучшая модель (Claude 3.5 Sonnet v2) достигает показателя успешности 69,67%. Однако возможности для улучшения остаются значительными, что задает сообществу четкое направление для дальнейшей оптимизации. Кроме того, эффективность существенно варьирует в зависимости от категории задач. ВЫВОДЫ Фреймворки и бенчмарки для агентных задач являются необходимым следующим шагом для развития потенциала и возможностей эффективного улучшения и интеграции...
Key Findings
1
Производительность LLM-агентов существенно различается между категориями задач, демонстрируя неравномерность их возможностей при работе с медицинскими EHR.
2
MedAgentBench представляет стандартизированный бенчмарк для оценки медицинских LLM-агентов на сложных интерактивных задачах в электронных медицинских картах.
3
MedAgentBench предоставляет интерактивную среду, совместимую с FHIR, использующую стандартные API и коммуникационную инфраструктуру EHR, что поддерживает возможную интеграцию с реальными системами.
4
Бенчмарк включает 300 созданных врачами задач для конкретных пациентов по 10 категориям, реалистичные профили 100 пациентов и более 700 000 элементов данных.
5
Бенчмарк остается недостаточно насыщенным: лучшая модель Claude 3.5 Sonnet v2 достигает показателя успешности 69,67%, что указывает на значительный потенциал улучшения.
Research Object
Виртуальная интерактивная электронная медицинская карта MedAgentBench, совместимая с FHIR и содержащая реалистичные профили пациентов и клинически сформулированные задания
Research Subject
Способность медицинских агентов на основе LLM решать задачи и их эффективность в интерактивной среде EHR, включая различия между категориями задач
Publication Details
Publication Date
2025-08-14
Journal
Publisher
ISSN
Cited by
55
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest