Атаки с внедрением промптов на большие языковые модели и системы ИИ-агентов: всесторонний обзор уязвимостей, векторов атак и механизмов защиты

Prompt Injection Attacks in Large Language Models and AI Agent Systems: A Comprehensive Review of Vulnerabilities, Attack Vectors, and Defense Mechanisms
Saidakhror Gulyamov, Said Saidakhrarovich Gulyamov, Andrey Rodionov, Rustam Khursanov, Kambariddin Mekhmonov, Djakhongir Babaev, Akmaljon Rakhimjonov
2026-01-07

системы ИИ-агентовпротокол контекста моделиотравление RAGбольшие языковые моделиатаки с внедрением промптов
Большие языковые модели (LLM) быстро преобразовали приложения искусственного интеллекта в различных отраслях, однако их интеграция в производственные системы выявила критические уязвимости безопасности, среди которых центральное место занимают атаки с внедрением промптов. В этом всестороннем обзоре обобщены результаты исследований за период с 2023 по 2025 год, проанализированы 45 ключевых источников, отраслевые отчёты по безопасности и документированные реальные эксплойты. Рассматривается таксономия методов внедрения промптов, включая прямой джейлбрейкинг и косвенное внедрение через внешний контент. Развитие систем ИИ-агентов и протокола контекста модели (Model Context Protocol, MCP) значительно расширило поверхность атак, создав такие уязвимости, как отравление инструментов и кража учётных данных. Описаны критические инциденты, включая уязвимость GitHub Copilot CVE-2025-53773, позволяющую удалённое выполнение кода (CVSS 9.6), и раскрытие лицензионного ключа Windows в ChatGPT. Исследования показывают, что всего пять тщательно подготовленных документов могут манипулировать ответами ИИ в 90% случаев посредством отравления генерации с дополнением извлечёнными данными (Retrieval-Augmented Generation, RAG). Предлагается PALADIN — многоуровневая система защиты, реализующая пять защитных уровней. В обзоре представлены практически применимые стратегии снижения рисков на основе OWASP Top 10 for LLM Applications 2025, выявлены фундаментальные ограничения, включая проблему стохастической природы и парадокс согласования, а также предложены направления исследований архитектурно безопасных систем ИИ. Наш анализ показывает, что внедрение промптов представляет собой фундаментальную архитектурную уязвимость, требующую многоуровневого подхода к защите, а не отдельных решений.
1
Системы ИИ-агентов и протокол Model Context Protocol расширяют поверхность атак, создавая уязвимости, включая отравление инструментов и кражу учетных данных.
2
Среди задокументированных инцидентов — уязвимость удаленного выполнения кода CVE-2025-53773 в GitHub Copilot с оценкой CVSS 9,6 и раскрытие лицензионного ключа Windows в ChatGPT.
3
Всего пять специально подготовленных документов могут манипулировать ответами ИИ в 90% случаев посредством отравления Retrieval-Augmented Generation.
4
Инъекция промптов рассматривается как фундаментальная архитектурная уязвимость, требующая эшелонированной защиты; предложенная пятиуровневая структура PALADIN иллюстрирует этот подход вместо единственной меры защиты.
5
Обзор обобщает 45 источников за 2023–2025 годы и классифицирует инъекции промптов на прямой джейлбрейкинг и косвенные атаки через внешний контент.

большие языковые модели и системы ИИ-агентов, интегрированные в производственные приложения

уязвимости, векторы атак, последствия и механизмы защиты от инъекций промптов, включая архитектурные ограничения безопасности

Publication Details
Publication Date
2026-01-07
Journal
Publisher
ISSN
Cited by
32
Access Type
Author Information
Authors
Saidakhror Gulyamov
Said Saidakhrarovich Gulyamov
Andrey Rodionov
Rustam Khursanov
Kambariddin Mekhmonov
Djakhongir Babaev
Akmaljon Rakhimjonov
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%