MAIA: многомерный бенчмарк для оценки медицинских ИИ-агентов
MAIA: A Multidimensional Benchmark for Assessing Medical AI Agents
2026-04-21
SCID: 54.1/6ef2en4e
Discuss with AI
биомедицинские графы знанийрассуждение по клиническим маршрутаммедицинские ИИ-агентымногошаговое рассуждениемногомерный бенчмарк
Figures from the paper
Abstract (AI)
Большие языковые модели демонстрируют значительный потенциал в медицинских сценариях, особенно в качестве автономных агентов для сложного клинического рассуждения. Строгая оценка необходима для обеспечения их надежности при применении в реальном здравоохранении. Однако существующие медицинские бенчмарки характеризуются узкой направленностью задач, зависимостью от общедоступных наборов данных, подверженных утечке данных, и ограниченным охватом разнообразных возможностей агентов. Для устранения этих недостатков мы представляем Medical AI Assessment (MAIA) — комплексный бенчмарк, оценивающий медицинских агентов по трем направлениям: медицинские вопросы на основе поиска, генерируемые с помощью биомедицинских API; задачи многошагового рассуждения, сформированные на основе отобранных биомедицинских графов знаний; и вопросы, требующие рассуждения по клиническим алгоритмам и построенные на основе авторитетных рекомендаций. MAIA использует большие языковые модели для автоматической генерации вопросов, снижая объем ручной работы при сохранении клинической достоверности и глубины рассуждения. Эксперименты с базовыми моделями и моделями, ориентированными на рассуждение, выявляют как сильные стороны, так и пробелы, подчеркивая ценность MAIA для развития методов оценки медицинских агентов. MAIA находится в открытом доступе по адресу https://huggingface.co/datasets/DiligentDing/MAIA.
Key Findings
1
Эксперименты с базовыми моделями и моделями рассуждения выявляют их сильные стороны и пробелы, демонстрируя полезность бенчмарка для комплексной оценки медицинских агентов.
2
Большие языковые модели автоматизируют генерацию вопросов, сохраняя клиническую достоверность и глубину рассуждений и снижая объём ручной работы.
3
MAIA — многомерный бенчмарк для оценки медицинских ИИ-агентов по поиску информации, многошаговому биомедицинскому рассуждению и рассуждению по клиническим маршрутам.
4
MAIA опубликован в открытом доступе, что обеспечивает возможность оценки и сравнения медицинских ИИ-агентов.
5
Бенчмарк включает вопросы, созданные через биомедицинские API, многошаговые задания на основе отобранных графов биомедицинских знаний и клинические вопросы из авторитетных руководств.
Research Object
медицинские ИИ-агенты
Research Subject
их надёжность и способности к ответам на медицинские вопросы на основе поиска, многошаговому биомедицинскому рассуждению и рассуждению по клиническим маршрутам
Publication Details
Publication Date
2026-04-21
Journal
Publisher
ISSN
Cited by
0
Access Type
Author Information
Download PDF
Subscribe to digest