На пути к заслуживающему доверия агентному искусственному интеллекту: всесторонний обзор безопасности, робастности, конфиденциальности и системной защиты

Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security
Jinhu Qi, Muzhi Li, Jiahong Liu, Yuqin Shu, D S F Yu, Shicheng Ma, Wenqian Cui, Yiyang Zhao, Yuehua Chen, Ruoxi Jiang, Irwin King, Zenglin Xu
2026-04-29

большие языковые моделиконфиденциальность и системная безопасностьмониторинг и верификация во время выполнениябезопасность и робастностьдоверенный агентный ИИ
Агентные системы искусственного интеллекта — большие языковые модели (LLM), дополненные планированием, использованием инструментов, памятью и взаимодействиями с длинным горизонтом — способны автономно выполнять сложные задачи, однако их многошаговые траектории порождают новые режимы отказа, ставящие под сомнение надежность таких систем. В этом обзоре рассматривается заслуживающий доверия агентный искусственный интеллект с акцентом на два ключевых измерения, критически важных для развертывания в условиях высокого риска: безопасность и робастность, а также конфиденциальность и системная защита. Для каждого измерения уточняются основные понятия, выявляются этапы рабочего процесса агента, на которых возникают риски, и обобщаются стратегии их поэтапного снижения. Другие аспекты надежности — согласование с ценностями, прозрачность, справедливость и подотчетность — рассматриваются в качестве релевантного контекста, а не как отдельные параллельные разделы. Для обеспечения согласованного сравнения и принятия решений о развертывании результаты оценки сведены в унифицированный блок метрик и тестовых наборов с акцентом как на сигналах результата, так и на сигналах процесса, включая нарушения ограничений, полноту трасс и показатели успешности атак, а также с рекомендациями по сопоставлению сценариев и метрик для принятия решений о выпуске. В заключение обозначены нерешенные проблемы, включая саморазвивающихся агентов, мониторинг и верификацию во время выполнения, персонализацию с сохранением конфиденциальности и компромисс между доверием и полезностью; кроме того, представлен тематический анализ реальных сбоев безопасности в агентных системах с открытым исходным кодом (OpenClaw/Moltbook). Цель работы — предоставить практический справочный материал для исследователей и специалистов, создающих заслуживающие доверия агентные системы для сред с высокими рисками.
1
Предложена унифицированная система метрик и бенчмарков, объединяющая сигналы результата и процесса, включая нарушения ограничений, полноту трасс и успешность атак, для принятия решений о допуске к развертыванию.
2
Планирование, использование инструментов, память и долгосрочные взаимодействия агентных систем ИИ создают специфические многошаговые отказы, осложняющие надежное развертывание.
3
В работе риски сопоставляются с этапами рабочего процесса агента, а также обобщаются стратегии смягчения, ориентированные на конкретные этапы его работы.
4
Ключевые открытые проблемы включают саморазвивающихся агентов, мониторинг и верификацию во время выполнения, персонализацию с сохранением конфиденциальности, компромисс между доверием и полезностью и реальные сбои безопасности в системах с открытым исходным кодом.
5
Обзор рассматривает надежность агентного ИИ через два измерения, критически важных для высокорисковых применений: безопасность и устойчивость, а также конфиденциальность и системную защищенность.

агентные системы искусственного интеллекта на основе больших языковых моделей с планированием, использованием инструментов, памятью и долгосрочными взаимодействиями

надёжность, с акцентом на безопасность, робастность, конфиденциальность и системную защищённость в автономных многоэтапных рабочих процессах

Publication Details
Publication Date
2026-04-29
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Jinhu Qi
Muzhi Li
Jiahong Liu
Yuqin Shu
D S F Yu
Shicheng Ma
Wenqian Cui
Yiyang Zhao
Yuehua Chen
Ruoxi Jiang
Irwin King
Zenglin Xu
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat →
Make a presentation
100%