Wily: Высокопроизводительная система обратной связи с учётом сложности для агентных AI-инструментов программирования

Wily: High-Performance Complexity Gated-Feedback for AI Coding Agents
Amin Beheshti, Anthony Shaw
2026-05-22

Claude Opus 4.6цикломатическая сложностьGPT-5.3-Codexиндекс поддерживаемостиSWE-benchWilyдельта сложностиуправляемая по сложности обратная связьанализ истории gitлогические строки кода
Агентные AI-инструменты для программирования теперь способны решать значительную долю реальных задач программной инженерии, однако создаваемые ими патчи систематически оказываются более сложными и менее сопровождаемыми, чем патчи, написанные квалифицированными инженерами-человеками. При отсутствии контроля широкое применение таких агентов ускорит накопление технического долга в производственных кодовых базах. Мы представляем Wily — высокопроизводительный инструмент анализа кода, который вычисляет цикломатическую сложность (Cyclomatic Complexity, CC), индекс сопровождаемости (Maintainability Index, MI) и логические строки кода (logical lines of code, LLOC) по всей истории git со скоростью более 570 000 LOC/s и работает до 55× быстрее существующих альтернатив. Мы интегрируем Wily в виде сигнала обратной связи, ограниченного по сложности (backpressure), в агентную среду SWE-bench: после каждого кандидатного патча агент получает отчёт о дельте сложности и может итеративно снижать регрессии. В контролируемом исследовании 500 верифицированных задач SWE-bench с двумя передовыми моделями — Claude Opus 4.6 и GPT-5.3-Codex — условие с обратной связью от Wily снижает средний рост сложности на 10–27% и рост LLOC на 8–23% по сравнению с контролем, получающим только информацию об успешности/неуспешности прохождения тестов, при этом сохраняя сопоставимые показатели разрешения задач (снижение менее 1.3 процентного пункта). Оба AI-условия остаются значительно хуже человеческого эталона по обоим моделям, что подтверждает устойчивый разрыв по сложности и мотивирует дальнейшие исследования по обучению агентов с учётом качества.
1
Обе условия с ИИ (с Wily и без) остаются значительно выше человеческого эталона по сложности, что указывает на сохраняющийся разрыв в сложности.
2
В контролируемом исследовании на 500 задачах SWE-bench Verified с моделями Claude Opus 4.6 и GPT-5.3-Codex обратная связь Wily сократила средний рост сложности на 10–27% по сравнению с обратной связью только о прохождении/провале тестов.
3
В том же исследовании обратная связь Wily сократила рост LLOC на 8–23% при сохранении сопоставимых показателей разрешения задач (снижение менее чем на 1,3 процентного пункта).
4
Wily — это высокопроизводительный инструмент анализа кода, который вычисляет цикломатическую сложность (CC), индекс поддерживаемости (MI) и логические строки кода (LLOC) по всей истории git со скоростью более 570 000 LOC/с.
5
Wily интегрирован как сигнал обратной связи с регулированием сложности (backpressure) в агентную среду SWE-bench, предоставляя агентам отчет об изменении сложности после каждого кандидатного патча.
6
Wily работает до 55× быстрее по сравнению с существующими альтернативами для вычисления метрик сложности кода по историям.

Инструмент анализа кода Wily, интегрированный в виде механизма обратной связи с учётом сложности в агентной тестовой системе для разработки ПО

Влияние предоставления дельта-отчётов по цикломатической сложности (Cyclomatic Complexity), индексу сопровождаемости (Maintainability Index) и логическим строкам кода (LLOC) в виде «ограничивающей» обратной связи на рост сложности патчей, рост LLOC и показатели решения задач агентами ИИ

Publication Details
Publication Date
2026-05-22
Journal
Publisher
ISSN
Cited by
0
Access Type
Author Information
Authors
Amin Beheshti
Anthony Shaw
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%