Развенчание мифов об агентах программной инженерии на основе больших языковых моделей
Demystifying LLM-Based Software Engineering Agents
2025-06-19
SCID: 54.1/3ju38ee6
Discuss with AI
Agentlessагенты программной инженерии на основе больших языковых моделейSWE-bench Liteавтоматизированное исправление программвалидация патчей
Figures from the paper
Abstract (AI)
Недавние достижения в области больших языковых моделей (LLM) значительно продвинули автоматизацию задач разработки программного обеспечения, включая синтез кода, исправление программ и генерацию тестов. В последнее время исследователи и специалисты отрасли разработали различные автономные агенты на основе LLM для выполнения сквозных задач разработки программного обеспечения. Эти агенты способны использовать инструменты, выполнять команды, наблюдать за обратной связью от среды и планировать дальнейшие действия. Однако сложность таких агентных подходов в сочетании с ограниченными возможностями современных LLM ставит следующий вопрос: действительно ли необходимо использовать сложных автономных программных агентов? Чтобы попытаться ответить на этот вопрос, мы создали Agentless — безагентный подход к автоматическому решению задач разработки программного обеспечения. В отличие от многословной и сложной конфигурации агентных подходов, Agentless использует простой трехфазный процесс, включающий локализацию, исправление и валидацию патча, не позволяя LLM самостоятельно определять дальнейшие действия или работать со сложными инструментами. Наши результаты на популярном бенчмарке SWE-bench Lite показывают, что, несмотря на простоту, Agentless способен обеспечить одновременно наивысшую производительность (32.00%, 96 корректно исправленных задач) и низкую стоимость ($0.70) по сравнению со всеми существующими агентами с открытым исходным кодом на момент подачи статьи! На новом бенчмарке SWE-bench Verified Agentless также достигает показателя решения более 50% при использовании Claude 3.5 Sonnet. Фактически, OpenAI уже приняла Agentless в качестве основного подхода для демонстрации производительности моделей GPT-4o и новых моделей серии o1 в решении реальных задач программирования; позднее Agentless также использовался DeepSeek для оценки их новейших моделей DeepSeek V3 и R1. Кроме того, мы вручную классифицировали задачи в SWE-bench Lite и обнаружили задачи с точными эталонными патчами, а также недостаточными или вводящими в заблуждение описаниями проблем. Поэтому мы создали SWE-bench Lite-𝑆, исключив такие проблемные задачи, чтобы проводить более строгую э...
Key Findings
1
Заявленная стоимость работы Agentless составила всего $0,70 при достигнутой результативности на SWE-bench Lite.
2
Agentless решает задачи разработки программного обеспечения с помощью простого трёхфазного процесса: локализации, исправления и проверки патча, без автономного планирования действий и сложных инструментов.
3
Ручной анализ выявил в SWE-bench Lite задачи с точными эталонными патчами либо недостаточными и вводящими в заблуждение описаниями, что послужило основанием для создания улучшенного бенчмарка SWE-bench Lite-S.
4
На SWE-bench Lite Agentless достиг наивысшей заявленной результативности среди открытых программных агентов на момент подачи статьи: 32,00%, или 96 корректных исправлений.
5
При использовании Claude 3.5 Sonnet Agentless превысил 50% долю решённых задач на бенчмарке SWE-bench Verified.
Research Object
Agentless — безагентный подход к автоматическому решению задач разработки программного обеспечения
Research Subject
эффективность, производительность и стоимость упрощённого трёхфазного процесса — локализации, исправления и проверки патчей — по сравнению с автономными агентами программной инженерии на базе LLM
Publication Details
Publication Date
2025-06-19
Journal
Publisher
ISSN
Cited by
80
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest