Атаки с внедрением промптов на большие языковые модели и системы ИИ-агентов: всесторонний обзор уязвимостей, векторов атак и механизмов защиты
Prompt Injection Attacks in Large Language Models and AI Agent Systems: A Comprehensive Review of Vulnerabilities, Attack Vectors, and Defense Mechanisms
2026-01-07
SCID: 54.1/6nemwvgh
Discuss with AI
системы ИИ-агентовпротокол контекста моделиотравление RAGбольшие языковые моделиатаки с внедрением промптов
Figures from the paper
Abstract (AI)
Большие языковые модели (LLM) быстро преобразовали приложения искусственного интеллекта в различных отраслях, однако их интеграция в производственные системы выявила критические уязвимости безопасности, среди которых центральное место занимают атаки с внедрением промптов. В этом всестороннем обзоре обобщены результаты исследований за период с 2023 по 2025 год, проанализированы 45 ключевых источников, отраслевые отчёты по безопасности и документированные реальные эксплойты. Рассматривается таксономия методов внедрения промптов, включая прямой джейлбрейкинг и косвенное внедрение через внешний контент. Развитие систем ИИ-агентов и протокола контекста модели (Model Context Protocol, MCP) значительно расширило поверхность атак, создав такие уязвимости, как отравление инструментов и кража учётных данных. Описаны критические инциденты, включая уязвимость GitHub Copilot CVE-2025-53773, позволяющую удалённое выполнение кода (CVSS 9.6), и раскрытие лицензионного ключа Windows в ChatGPT. Исследования показывают, что всего пять тщательно подготовленных документов могут манипулировать ответами ИИ в 90% случаев посредством отравления генерации с дополнением извлечёнными данными (Retrieval-Augmented Generation, RAG). Предлагается PALADIN — многоуровневая система защиты, реализующая пять защитных уровней. В обзоре представлены практически применимые стратегии снижения рисков на основе OWASP Top 10 for LLM Applications 2025, выявлены фундаментальные ограничения, включая проблему стохастической природы и парадокс согласования, а также предложены направления исследований архитектурно безопасных систем ИИ. Наш анализ показывает, что внедрение промптов представляет собой фундаментальную архитектурную уязвимость, требующую многоуровневого подхода к защите, а не отдельных решений.
Key Findings
1
Системы ИИ-агентов и протокол Model Context Protocol расширяют поверхность атак, создавая уязвимости, включая отравление инструментов и кражу учетных данных.
2
Среди задокументированных инцидентов — уязвимость удаленного выполнения кода CVE-2025-53773 в GitHub Copilot с оценкой CVSS 9,6 и раскрытие лицензионного ключа Windows в ChatGPT.
3
Всего пять специально подготовленных документов могут манипулировать ответами ИИ в 90% случаев посредством отравления Retrieval-Augmented Generation.
4
Инъекция промптов рассматривается как фундаментальная архитектурная уязвимость, требующая эшелонированной защиты; предложенная пятиуровневая структура PALADIN иллюстрирует этот подход вместо единственной меры защиты.
5
Обзор обобщает 45 источников за 2023–2025 годы и классифицирует инъекции промптов на прямой джейлбрейкинг и косвенные атаки через внешний контент.
Research Object
большие языковые модели и системы ИИ-агентов, интегрированные в производственные приложения
Research Subject
уязвимости, векторы атак, последствия и механизмы защиты от инъекций промптов, включая архитектурные ограничения безопасности
Publication Details
Publication Date
2026-01-07
Journal
Publisher
ISSN
Cited by
32
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest