MAIA: многомерный бенчмарк для оценки медицинских ИИ-агентов

MAIA: A Multidimensional Benchmark for Assessing Medical AI Agents
Xin Ding, Jiaxin Ding, Yule Xie, Xinbing Wang, Biao Peng, Yan Li, Yichen Li, Andrew Huang, Yinan Wang
2026-04-21

биомедицинские графы знанийрассуждение по клиническим маршрутаммедицинские ИИ-агентымногошаговое рассуждениемногомерный бенчмарк
Большие языковые модели демонстрируют значительный потенциал в медицинских сценариях, особенно в качестве автономных агентов для сложного клинического рассуждения. Строгая оценка необходима для обеспечения их надежности при применении в реальном здравоохранении. Однако существующие медицинские бенчмарки характеризуются узкой направленностью задач, зависимостью от общедоступных наборов данных, подверженных утечке данных, и ограниченным охватом разнообразных возможностей агентов. Для устранения этих недостатков мы представляем Medical AI Assessment (MAIA) — комплексный бенчмарк, оценивающий медицинских агентов по трем направлениям: медицинские вопросы на основе поиска, генерируемые с помощью биомедицинских API; задачи многошагового рассуждения, сформированные на основе отобранных биомедицинских графов знаний; и вопросы, требующие рассуждения по клиническим алгоритмам и построенные на основе авторитетных рекомендаций. MAIA использует большие языковые модели для автоматической генерации вопросов, снижая объем ручной работы при сохранении клинической достоверности и глубины рассуждения. Эксперименты с базовыми моделями и моделями, ориентированными на рассуждение, выявляют как сильные стороны, так и пробелы, подчеркивая ценность MAIA для развития методов оценки медицинских агентов. MAIA находится в открытом доступе по адресу https://huggingface.co/datasets/DiligentDing/MAIA.
1
Эксперименты с базовыми моделями и моделями рассуждения выявляют их сильные стороны и пробелы, демонстрируя полезность бенчмарка для комплексной оценки медицинских агентов.
2
Большие языковые модели автоматизируют генерацию вопросов, сохраняя клиническую достоверность и глубину рассуждений и снижая объём ручной работы.
3
MAIA — многомерный бенчмарк для оценки медицинских ИИ-агентов по поиску информации, многошаговому биомедицинскому рассуждению и рассуждению по клиническим маршрутам.
4
MAIA опубликован в открытом доступе, что обеспечивает возможность оценки и сравнения медицинских ИИ-агентов.
5
Бенчмарк включает вопросы, созданные через биомедицинские API, многошаговые задания на основе отобранных графов биомедицинских знаний и клинические вопросы из авторитетных руководств.

медицинские ИИ-агенты

их надёжность и способности к ответам на медицинские вопросы на основе поиска, многошаговому биомедицинскому рассуждению и рассуждению по клиническим маршрутам

Publication Details
Publication Date
2026-04-21
Journal
Publisher
ISSN
Cited by
0
Access Type
Author Information
Authors
Xin Ding
Jiaxin Ding
Yule Xie
Xinbing Wang
Biao Peng
Yan Li
Yichen Li
Andrew Huang
Yinan Wang
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%