Оценка и бенчмаркинг агентов на основе больших языковых моделей: обзор

Evaluation and Benchmarking of LLM Agents: A Survey
Mahmoud Mohammadi, Yipeng Li, Jane C. Lo, Wendy Yip
2025-08-03

оценка LLM-агентовнадёжность агентовбезопасность агентовбенчмаркингтаксономия оценки
Появление агентов на основе больших языковых моделей (LLM) открыло новые направления применения искусственного интеллекта, однако оценка таких агентов остается сложной и недостаточно разработанной областью. В этом обзоре представлен подробный анализ формирующейся области оценки агентов на основе LLM и предложена двумерная таксономия, систематизирующая существующие исследования по двум направлениям: (1) цели оценки — что именно оценивается, например поведение агента, его возможности, надежность и безопасность, — и (2) процесс оценки — как проводится оценивание, включая режимы взаимодействия, наборы данных и бенчмарки, методы вычисления метрик и программные инструменты. Помимо таксономии, мы рассматриваем специфические для предприятий проблемы, такие как ролевой доступ к данным, необходимость гарантий надежности, динамические взаимодействия с длительным горизонтом и соблюдение нормативных требований, которым в современных исследованиях часто не уделяется достаточного внимания. Также определены перспективные направления дальнейших исследований, включая комплексную, более реалистичную и масштабируемую оценку. Эта работа призвана внести ясность во фрагментированную область оценки агентов и предложить основу для систематического оценивания, позволяющую исследователям и практикам оценивать агентов на основе LLM для применения в реальных условиях.
1
Оценка в корпоративной среде должна учитывать ролевой доступ к данным, гарантии надёжности, динамические и долгосрочные взаимодействия, а также требования соответствия нормативам.
2
Будущие исследования должны разрабатывать целостные, реалистичные и масштабируемые методы оценки для практического внедрения LLM-агентов.
3
Оценка LLM-агентов остаётся сложной и недостаточно развитой, несмотря на быстрое расширение приложений на основе агентов.
4
Измерение процессов оценки охватывает режимы взаимодействия, наборы данных и бенчмарки, методы вычисления метрик и вспомогательные инструменты.
5
В обзоре предложена двумерная таксономия, организующая оценку по целям — поведению, способностям, надёжности и безопасности — и по процессам оценки.

агенты на основе больших языковых моделей (LLM)

оценка и бенчмаркинг поведения, способностей, надёжности и безопасности агентов, включая систематическое оценивание в реалистичных, динамичных и долгосрочных взаимодействиях, а также в условиях корпоративных и нормативных ограничений

Publication Details
Publication Date
2025-08-03
Journal
Publisher
ISSN
Cited by
57
Access Type
Author Information
Authors
Mahmoud Mohammadi
Yipeng Li
Jane C. Lo
Wendy Yip
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%