AgentClinic: мультимодальный бенчмарк для клинических ИИ-агентов, использующих инструменты
AgentClinic: a multimodal benchmark for tool-using clinical AI agents
2026-04-27
SCID: 54.1/a89b5wv2
Discuss with AI
бенчмарк клинического моделированияэлектронные медицинские картымультимодальные клинические ИИ-агентыпоследовательное принятие решенийиспользование инструментов
Figures from the paper
Abstract (AI)
Оценка больших языковых моделей (LLM) в клинических сценариях имеет ключевое значение для определения их потенциальной клинической полезности. Существующие бенчмарки в значительной степени опираются на статическое формирование ответов на вопросы, что не отражает сложную последовательную природу принятия клинических решений. В настоящей работе мы представляем AgentClinic — мультимодальный бенчмарк для агентов, предназначенный для оценки LLM в моделируемых клинических средах, включающих взаимодействие с пациентами, сбор мультимодальных данных в условиях неполной информации и использование различных инструментов, что обеспечивает углублённую оценку по девяти медицинским специальностям и семи языкам. Мы обнаружили, что решение задач MedQA в формате последовательного принятия решений, реализованном в AgentClinic, существенно сложнее, вследствие чего диагностическая точность может снизиться до уровня менее одной десятой от исходной. В целом мы наблюдаем, что агенты на базе Claude-3.5 превосходят агентов на базе других языковых моделей в большинстве условий. Тем не менее выявляются резкие различия в способности LLM использовать такие инструменты, как обучение на опыте, адаптивное извлечение информации и циклы рефлексии. Особенно примечательно, что Llama-3 демонстрирует относительное улучшение результатов до 92% при использовании инструмента блокнота, позволяющего записывать и редактировать заметки, сохраняющиеся между отдельными случаями. Для дополнительной проверки наших клинических симуляций мы используем реальные электронные медицинские карты, проводим исследование с участием клинических экспертов-оценщиков, вносим в агентов различные смещения и исследуем ориентированные на пациента метрики, доступные благодаря этой интерактивной среде.
Key Findings
1
AgentClinic представляет мультимодальный бенчмарк для клинических агентов, использующих инструменты, в смоделированных средах с взаимодействием с пациентами, неполной информацией и последовательным применением инструментов.
2
Агенты на базе Claude-3.5 превосходят другие исследованные LLM в большинстве условий, однако модели значительно различаются по способности использовать инструменты для обучения на опыте, адаптивного поиска и циклов рефлексии.
3
Llama-3 демонстрирует относительное улучшение до 92% при использовании постоянного блокнота для записи и редактирования заметок между случаями.
4
Преобразование задач MedQA в формат последовательного принятия решений существенно повышает сложность: диагностическая точность может снижаться до менее одной десятой исходного уровня.
5
Бенчмарк оценивает клинических агентов по девяти медицинским специальностям и на семи языках, выходя за рамки статических задач «вопрос—ответ».
6
Бенчмарк дополнительно исследуется с использованием реальных электронных медицинских записей, клинического читательского исследования, возмущений, моделирующих предвзятость, и ориентированных на пациента метрик, доступных в интерактивных симуляциях.
Research Object
клинические ИИ-агенты на основе больших языковых моделей, работающие в моделируемых мультимодальных клинических средах
Research Subject
их последовательное принятие клинических решений, диагностическая точность, использование инструментов и показатели эффективности, ориентированные на пациента, в условиях неполной информации
Publication Details
Publication Date
2026-04-27
Journal
Publisher
ISSN
Cited by
7
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest