Определение и обнаружение дефектов автономных агентов на основе больших языковых моделей
Defining and Detecting the Defects of Large Language Model-Based Autonomous Agents
2026-01-28
SCID: 54.1/u948w6wm
Discuss with AI
Agentableграфы свойств кодаавтономные агенты на основе больших языковых моделейдефекты кода агентовстатический анализ
Figures from the paper
Abstract (AI)
Агенты искусственного интеллекта (ИИ) — это системы, способные воспринимать окружающую среду, автономно планировать и выполнять задачи. Последние достижения в области больших языковых моделей (LLM) сформировали новую парадигму для ИИ-агентов, позволив им взаимодействовать с внешними ресурсами и инструментами с помощью методов промптинга. Это развитие значительно расширило возможности LLM и сделало ИИ-агентов на основе LLM важным направлением исследований. В таких агентах рабочий процесс объединяет код, написанный разработчиками и отвечающий за построение фреймворка и управление логикой, с естественным языком, генерируемым LLM и улучшающим динамическое принятие решений и взаимодействие. Однако несогласованность между выводами LLM и логикой разработчика может приводить к дефектам, таким как сбои при вызове инструментов. Эти проблемы создают специфические риски и приводят к различным дефектам ИИ-агентов на основе LLM, включая перебои в обслуживании и некорректные результаты. Несмотря на важность этих проблем, систематических исследований, направленных на анализ ИИ-агентов на основе LLM для выявления дефектов в их коде, недостаточно. Для устранения этого пробела мы представляем первое исследование, посвящённое выявлению и обнаружению дефектов в LLM-агентах. Мы собрали и проанализировали 14 754 релевантных отчёта разработчиков с платформ StackOverflow и GitHub. Затем мы отфильтровали 2 604 содержательных публикации, чтобы определить и классифицировать восемь типов дефектов кода агентов. Далее мы разработали инструмент статического анализа Agentable для обнаружения этих дефектов. Agentable использует графы свойств кода (Code Property Graphs, CPGs) и LLM для анализа рабочих процессов агентов, эффективно выявляя специфические шаблоны кода и анализируя описания на естественном языке. Для оценки Agentable мы сформировали два набора данных: AgentSet, включающий 84 реальных проекта агентов, и AgentTest, содержащий 78 проектов агентов, специально созданных для включения различных типов дефектов. Результаты оценки показывают, что точность Agentable на наборе данных реальных агентов составляет 88,79%, а полнота — 91,03% на ...
Key Findings
1
Agentable достиг точности 88,79% на наборе реальных проектов и полноты 91,03% на наборе проектов с дефектами.
2
Анализ 14 754 сообщений из StackOverflow и GitHub позволил отобрать 2 604 релевантных публикации и определить восемь типов дефектов кода агентов.
3
Для оценки созданы AgentSet из 84 реальных проектов агентов и AgentTest из 78 проектов с намеренно внесёнными дефектами.
4
Разработан статический анализатор Agentable, объединяющий графы свойств кода и большие языковые модели для обнаружения шаблонов кода и анализа текстовых описаний рабочих процессов.
5
В работе впервые проведён систематический анализ, направленный на определение и обнаружение дефектов в автономных агентах на основе больших языковых моделей.
Research Object
автономные агенты на основе LLM и их код/рабочие процессы
Research Subject
дефекты кода агентов, включая их типы, причины и обнаружение
Publication Details
Publication Date
2026-01-28
Journal
Publisher
ISSN
Cited by
2
Access Type
Author Information
Download PDF
Subscribe to digest