Оценка и бенчмаркинг агентов на основе больших языковых моделей: обзор
Evaluation and Benchmarking of LLM Agents: A Survey
2025-08-03
SCID: 54.1/6qbz9z7p
Discuss with AI
оценка LLM-агентовнадёжность агентовбезопасность агентовбенчмаркингтаксономия оценки
Figures from the paper
Abstract (AI)
Появление агентов на основе больших языковых моделей (LLM) открыло новые направления применения искусственного интеллекта, однако оценка таких агентов остается сложной и недостаточно разработанной областью. В этом обзоре представлен подробный анализ формирующейся области оценки агентов на основе LLM и предложена двумерная таксономия, систематизирующая существующие исследования по двум направлениям: (1) цели оценки — что именно оценивается, например поведение агента, его возможности, надежность и безопасность, — и (2) процесс оценки — как проводится оценивание, включая режимы взаимодействия, наборы данных и бенчмарки, методы вычисления метрик и программные инструменты. Помимо таксономии, мы рассматриваем специфические для предприятий проблемы, такие как ролевой доступ к данным, необходимость гарантий надежности, динамические взаимодействия с длительным горизонтом и соблюдение нормативных требований, которым в современных исследованиях часто не уделяется достаточного внимания. Также определены перспективные направления дальнейших исследований, включая комплексную, более реалистичную и масштабируемую оценку. Эта работа призвана внести ясность во фрагментированную область оценки агентов и предложить основу для систематического оценивания, позволяющую исследователям и практикам оценивать агентов на основе LLM для применения в реальных условиях.
Key Findings
1
Оценка в корпоративной среде должна учитывать ролевой доступ к данным, гарантии надёжности, динамические и долгосрочные взаимодействия, а также требования соответствия нормативам.
2
Будущие исследования должны разрабатывать целостные, реалистичные и масштабируемые методы оценки для практического внедрения LLM-агентов.
3
Оценка LLM-агентов остаётся сложной и недостаточно развитой, несмотря на быстрое расширение приложений на основе агентов.
4
Измерение процессов оценки охватывает режимы взаимодействия, наборы данных и бенчмарки, методы вычисления метрик и вспомогательные инструменты.
5
В обзоре предложена двумерная таксономия, организующая оценку по целям — поведению, способностям, надёжности и безопасности — и по процессам оценки.
Research Object
агенты на основе больших языковых моделей (LLM)
Research Subject
оценка и бенчмаркинг поведения, способностей, надёжности и безопасности агентов, включая систематическое оценивание в реалистичных, динамичных и долгосрочных взаимодействиях, а также в условиях корпоративных и нормативных ограничений
Publication Details
Publication Date
2025-08-03
Journal
Publisher
ISSN
Cited by
57
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest