Развенчание мифов об агентах программной инженерии на основе больших языковых моделей

Demystifying LLM-Based Software Engineering Agents
Chunqiu Steven Xia, Yinlin Deng, Soren Dunn, Lingming Zhang
2025-06-19

Agentlessагенты программной инженерии на основе больших языковых моделейSWE-bench Liteавтоматизированное исправление программвалидация патчей
Недавние достижения в области больших языковых моделей (LLM) значительно продвинули автоматизацию задач разработки программного обеспечения, включая синтез кода, исправление программ и генерацию тестов. В последнее время исследователи и специалисты отрасли разработали различные автономные агенты на основе LLM для выполнения сквозных задач разработки программного обеспечения. Эти агенты способны использовать инструменты, выполнять команды, наблюдать за обратной связью от среды и планировать дальнейшие действия. Однако сложность таких агентных подходов в сочетании с ограниченными возможностями современных LLM ставит следующий вопрос: действительно ли необходимо использовать сложных автономных программных агентов? Чтобы попытаться ответить на этот вопрос, мы создали Agentless — безагентный подход к автоматическому решению задач разработки программного обеспечения. В отличие от многословной и сложной конфигурации агентных подходов, Agentless использует простой трехфазный процесс, включающий локализацию, исправление и валидацию патча, не позволяя LLM самостоятельно определять дальнейшие действия или работать со сложными инструментами. Наши результаты на популярном бенчмарке SWE-bench Lite показывают, что, несмотря на простоту, Agentless способен обеспечить одновременно наивысшую производительность (32.00%, 96 корректно исправленных задач) и низкую стоимость ($0.70) по сравнению со всеми существующими агентами с открытым исходным кодом на момент подачи статьи! На новом бенчмарке SWE-bench Verified Agentless также достигает показателя решения более 50% при использовании Claude 3.5 Sonnet. Фактически, OpenAI уже приняла Agentless в качестве основного подхода для демонстрации производительности моделей GPT-4o и новых моделей серии o1 в решении реальных задач программирования; позднее Agentless также использовался DeepSeek для оценки их новейших моделей DeepSeek V3 и R1. Кроме того, мы вручную классифицировали задачи в SWE-bench Lite и обнаружили задачи с точными эталонными патчами, а также недостаточными или вводящими в заблуждение описаниями проблем. Поэтому мы создали SWE-bench Lite-𝑆, исключив такие проблемные задачи, чтобы проводить более строгую э...
1
Заявленная стоимость работы Agentless составила всего $0,70 при достигнутой результативности на SWE-bench Lite.
2
Agentless решает задачи разработки программного обеспечения с помощью простого трёхфазного процесса: локализации, исправления и проверки патча, без автономного планирования действий и сложных инструментов.
3
Ручной анализ выявил в SWE-bench Lite задачи с точными эталонными патчами либо недостаточными и вводящими в заблуждение описаниями, что послужило основанием для создания улучшенного бенчмарка SWE-bench Lite-S.
4
На SWE-bench Lite Agentless достиг наивысшей заявленной результативности среди открытых программных агентов на момент подачи статьи: 32,00%, или 96 корректных исправлений.
5
При использовании Claude 3.5 Sonnet Agentless превысил 50% долю решённых задач на бенчмарке SWE-bench Verified.

Agentless — безагентный подход к автоматическому решению задач разработки программного обеспечения

эффективность, производительность и стоимость упрощённого трёхфазного процесса — локализации, исправления и проверки патчей — по сравнению с автономными агентами программной инженерии на базе LLM

Publication Details
Publication Date
2025-06-19
Journal
Publisher
ISSN
Cited by
80
Access Type
Author Information
Authors
Chunqiu Steven Xia
Yinlin Deng
Soren Dunn
Lingming Zhang
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%