От рассуждений больших языковых моделей к автономным ИИ-агентам: всесторонний обзор

From LLM Reasoning to Autonomous AI Agents: A Comprehensive Review
Mohamed Amine Ferrag, Norbert Tihanyi, Mérouane Debbah
2026-01-01

фреймворки ИИ-агентовавтономные ИИ-агентыоценочные бенчмаркибольшие языковые моделипротоколы взаимодействия мультиагентных систем
Большие языковые модели и автономные ИИ-агенты быстро развиваются, что привело к появлению разнообразного набора оценочных бенчмарков, фреймворков и протоколов взаимодействия. В связи с растущей потребностью в стандартизированной оценке и интеграции мы систематически объединяем эти разрозненные разработки в единую структуру. Однако данная область по-прежнему фрагментирована и не располагает унифицированной таксономией или всеобъемлющим обзором. Поэтому мы представляем сопоставительное сравнение бенчмарков, разработанных в период с 2019 по 2025 год, предназначенных для оценки этих моделей и агентов в различных предметных областях. Кроме того, мы предлагаем таксономию примерно 60 бенчмарков, охватывающих рассуждения на основе общих и академических знаний, решение математических задач, генерацию кода и разработку программного обеспечения, фактическое обоснование и поиск информации, специализированные предметные оценки, мультимодальные и воплощённые задачи, оркестрацию задач и интерактивные оценки. Далее мы рассматриваем фреймворки ИИ-агентов, представленные в период с 2023 по 2025 год, которые интегрируют большие языковые модели с модульными инструментальными наборами для обеспечения автономного принятия решений и многоэтапного рассуждения. Кроме того, мы представляем реальные применения автономных ИИ-агентов в материаловедении, биомедицинских исследованиях, формировании научных идей, разработке программного обеспечения, генерации синтетических данных, химическом рассуждении, решении математических задач, географических информационных системах, мультимедиа, здравоохранении и финансах. Затем мы рассматриваем ключевые протоколы взаимодействия агентов, а именно протокол коммуникации агентов (Agent Communication Protocol, ACP), протокол контекста модели (Model Context Protocol, MCP) и протокол взаимодействия «агент—агент» (Agent-to-Agent Protocol, A2A). Наконец, мы обсуждаем рекомендации для будущих исследований, уделяя особое внимание передовым стратегиям рассуждения, режимам отказа в мультиагентных системах на основе больших языковых моделей, автоматизированному научному открытию, динамической интеграции инструментов посредством обучения с подкреплением, интегрированным возможностям поиска и уязвимостям безопасности в протоколах взаимодействия агентов.
1
Предложена таксономия примерно 60 бенчмарков, охватывающих рассуждение, математику, программирование, фактическую обоснованность, специализированные области, мультимодальные задачи, оркестрацию и взаимодействие.
2
Рассмотрены фреймворки ИИ-агентов, представленные в 2023–2025 годах, которые объединяют большие языковые модели с модульными инструментами для автономного принятия решений и многошагового рассуждения.
3
Обзор объединяет разрозненные бенчмарки, фреймворки агентов и протоколы взаимодействия для больших языковых моделей и автономных ИИ-агентов.
4
Выделены применения автономных агентов в научных исследованиях, разработке программного обеспечения, здравоохранении, финансах, мультимедиа и других областях; обозначены приоритеты, включая анализ отказов, интеграцию инструментов, научные открытия и безопасность протоколов.
5
Проведено сопоставление бенчмарков, разработанных в 2019–2025 годах, по различным направлениям оценки для поддержки стандартизированного тестирования.

большие языковые модели и автономные ИИ-агенты

их оценочные бенчмарки, таксономии, фреймворки, применения, протоколы взаимодействия, способности к рассуждению и интеграция для автономного принятия решений

Publication Details
Publication Date
2026-01-01
Journal
Publisher
ISSN
Cited by
7
Access Type
Author Information
Authors
Mohamed Amine Ferrag
Norbert Tihanyi
Mérouane Debbah
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%