На пути к заслуживающему доверия агентному искусственному интеллекту: всесторонний обзор безопасности, робастности, конфиденциальности и системной защиты
Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security
2026-04-29
SCID: 54.1/4dkkmdj9
Discuss with AI
большие языковые моделиконфиденциальность и системная безопасностьмониторинг и верификация во время выполнениябезопасность и робастностьдоверенный агентный ИИ
Figures from the paper
Abstract (AI)
Агентные системы искусственного интеллекта — большие языковые модели (LLM), дополненные планированием, использованием инструментов, памятью и взаимодействиями с длинным горизонтом — способны автономно выполнять сложные задачи, однако их многошаговые траектории порождают новые режимы отказа, ставящие под сомнение надежность таких систем. В этом обзоре рассматривается заслуживающий доверия агентный искусственный интеллект с акцентом на два ключевых измерения, критически важных для развертывания в условиях высокого риска: безопасность и робастность, а также конфиденциальность и системная защита. Для каждого измерения уточняются основные понятия, выявляются этапы рабочего процесса агента, на которых возникают риски, и обобщаются стратегии их поэтапного снижения. Другие аспекты надежности — согласование с ценностями, прозрачность, справедливость и подотчетность — рассматриваются в качестве релевантного контекста, а не как отдельные параллельные разделы. Для обеспечения согласованного сравнения и принятия решений о развертывании результаты оценки сведены в унифицированный блок метрик и тестовых наборов с акцентом как на сигналах результата, так и на сигналах процесса, включая нарушения ограничений, полноту трасс и показатели успешности атак, а также с рекомендациями по сопоставлению сценариев и метрик для принятия решений о выпуске. В заключение обозначены нерешенные проблемы, включая саморазвивающихся агентов, мониторинг и верификацию во время выполнения, персонализацию с сохранением конфиденциальности и компромисс между доверием и полезностью; кроме того, представлен тематический анализ реальных сбоев безопасности в агентных системах с открытым исходным кодом (OpenClaw/Moltbook). Цель работы — предоставить практический справочный материал для исследователей и специалистов, создающих заслуживающие доверия агентные системы для сред с высокими рисками.
Key Findings
1
Предложена унифицированная система метрик и бенчмарков, объединяющая сигналы результата и процесса, включая нарушения ограничений, полноту трасс и успешность атак, для принятия решений о допуске к развертыванию.
2
Планирование, использование инструментов, память и долгосрочные взаимодействия агентных систем ИИ создают специфические многошаговые отказы, осложняющие надежное развертывание.
3
В работе риски сопоставляются с этапами рабочего процесса агента, а также обобщаются стратегии смягчения, ориентированные на конкретные этапы его работы.
4
Ключевые открытые проблемы включают саморазвивающихся агентов, мониторинг и верификацию во время выполнения, персонализацию с сохранением конфиденциальности, компромисс между доверием и полезностью и реальные сбои безопасности в системах с открытым исходным кодом.
5
Обзор рассматривает надежность агентного ИИ через два измерения, критически важных для высокорисковых применений: безопасность и устойчивость, а также конфиденциальность и системную защищенность.
Research Object
агентные системы искусственного интеллекта на основе больших языковых моделей с планированием, использованием инструментов, памятью и долгосрочными взаимодействиями
Research Subject
надёжность, с акцентом на безопасность, робастность, конфиденциальность и системную защищённость в автономных многоэтапных рабочих процессах
Publication Details
Publication Date
2026-04-29
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest