AgentClinic: мультимодальный бенчмарк для клинических ИИ-агентов, использующих инструменты

AgentClinic: a multimodal benchmark for tool-using clinical AI agents
Jae‐Joong Kim, Eduardo Pontes Reis, Samuel Schmidgall, Rojin Ziaei, Carl Harris, Jeffrey Jopling, Michael Moor
2026-04-27

бенчмарк клинического моделированияэлектронные медицинские картымультимодальные клинические ИИ-агентыпоследовательное принятие решенийиспользование инструментов
Оценка больших языковых моделей (LLM) в клинических сценариях имеет ключевое значение для определения их потенциальной клинической полезности. Существующие бенчмарки в значительной степени опираются на статическое формирование ответов на вопросы, что не отражает сложную последовательную природу принятия клинических решений. В настоящей работе мы представляем AgentClinic — мультимодальный бенчмарк для агентов, предназначенный для оценки LLM в моделируемых клинических средах, включающих взаимодействие с пациентами, сбор мультимодальных данных в условиях неполной информации и использование различных инструментов, что обеспечивает углублённую оценку по девяти медицинским специальностям и семи языкам. Мы обнаружили, что решение задач MedQA в формате последовательного принятия решений, реализованном в AgentClinic, существенно сложнее, вследствие чего диагностическая точность может снизиться до уровня менее одной десятой от исходной. В целом мы наблюдаем, что агенты на базе Claude-3.5 превосходят агентов на базе других языковых моделей в большинстве условий. Тем не менее выявляются резкие различия в способности LLM использовать такие инструменты, как обучение на опыте, адаптивное извлечение информации и циклы рефлексии. Особенно примечательно, что Llama-3 демонстрирует относительное улучшение результатов до 92% при использовании инструмента блокнота, позволяющего записывать и редактировать заметки, сохраняющиеся между отдельными случаями. Для дополнительной проверки наших клинических симуляций мы используем реальные электронные медицинские карты, проводим исследование с участием клинических экспертов-оценщиков, вносим в агентов различные смещения и исследуем ориентированные на пациента метрики, доступные благодаря этой интерактивной среде.
1
AgentClinic представляет мультимодальный бенчмарк для клинических агентов, использующих инструменты, в смоделированных средах с взаимодействием с пациентами, неполной информацией и последовательным применением инструментов.
2
Агенты на базе Claude-3.5 превосходят другие исследованные LLM в большинстве условий, однако модели значительно различаются по способности использовать инструменты для обучения на опыте, адаптивного поиска и циклов рефлексии.
3
Llama-3 демонстрирует относительное улучшение до 92% при использовании постоянного блокнота для записи и редактирования заметок между случаями.
4
Преобразование задач MedQA в формат последовательного принятия решений существенно повышает сложность: диагностическая точность может снижаться до менее одной десятой исходного уровня.
5
Бенчмарк оценивает клинических агентов по девяти медицинским специальностям и на семи языках, выходя за рамки статических задач «вопрос—ответ».
6
Бенчмарк дополнительно исследуется с использованием реальных электронных медицинских записей, клинического читательского исследования, возмущений, моделирующих предвзятость, и ориентированных на пациента метрик, доступных в интерактивных симуляциях.

клинические ИИ-агенты на основе больших языковых моделей, работающие в моделируемых мультимодальных клинических средах

их последовательное принятие клинических решений, диагностическая точность, использование инструментов и показатели эффективности, ориентированные на пациента, в условиях неполной информации

Publication Details
Publication Date
2026-04-27
Journal
Publisher
ISSN
Cited by
7
Access Type
Author Information
Authors
Jae‐Joong Kim
Eduardo Pontes Reis
Samuel Schmidgall
Rojin Ziaei
Carl Harris
Jeffrey Jopling
Michael Moor
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat →
Make a presentation
100%