InjecAgent: бенчмаркинг косвенных внедрений промптов в агентных системах на основе больших языковых моделей с интеграцией инструментов

InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated Large Language Model Agents
Zhixiang Liang, Qiusi Zhan, Zifan Ying, Daniel Kang
2024-01-01

бенчмарк INJECAGENTуспешность атаккосвенная инъекция промптаэксфильтрация частных данныхLLM-агенты с интеграцией инструментов
Недавние исследования реализовали большие языковые модели (LLM) в виде агентов, что позволяет им получать доступ к инструментам, выполнять действия и взаимодействовать с внешним содержимым, например электронными письмами или веб-сайтами. Однако внешнее содержимое создает риск атак с косвенным внедрением промптов (IPI), при которых вредоносные инструкции встраиваются в обрабатываемое LLM содержимое с целью манипулирования агентами и побуждения их к выполнению действий, наносящих ущерб пользователям. Учитывая потенциально серьезные последствия таких атак, необходимо создавать бенчмарки для оценки этих рисков и их снижения. В данной работе мы представляем INJECAGENT — бенчмарк, предназначенный для оценки уязвимости агентных систем на основе LLM с интеграцией инструментов к атакам IPI. INJECAGENT включает 1 054 тестовых случая, охватывающих 17 различных пользовательских инструментов и 62 инструмента атакующего. Мы классифицируем цели атак по двум основным типам: непосредственное причинение вреда пользователям и эксфильтрация конфиденциальных данных. Мы оцениваем 30 различных агентных систем на основе LLM и показываем, что агенты уязвимы к атакам IPI: GPT-4 с промптингом ReAct оказывается уязвимой к атакам в 24% случаев. Дополнительное исследование расширенного сценария, в котором инструкции атакующего усиливаются хакерским промптом, показывает дальнейшее повышение доли успешных атак — почти двукратное увеличение показателя успешности атак на GPT-4 с промптингом ReAct. Наши результаты ставят под вопрос широкомасштабное развертывание агентных систем на основе LLM. Бенчмарк доступен по адресу: https://github.com/
1
Цели атак разделены на два типа: непосредственный вред пользователям и извлечение конфиденциальных данных.
2
Оценка 30 LLM-агентов продемонстрировала их широкую уязвимость к атакам косвенной инъекции промптов.
3
INJECAGENT представляет бенчмарк для оценки уязвимости интегрированных с инструментами LLM-агентов к косвенным инъекциям промптов.
4
ReAct-агент на основе GPT-4 успешно атаковывался в 24% случаев; при усилении инструкций атакующего хакерским промптом успешность атак почти удваивалась.
5
Бенчмарк содержит 1 054 тестовых случая, охватывающих 17 пользовательских инструментов и 62 инструмента атакующих.

интегрированные с инструментами агенты на основе больших языковых моделей, подвергающиеся атакам косвенного внедрения подсказок через внешний контент

уязвимость к атакам косвенного внедрения подсказок, включая выполнение вредоносных действий и эксфильтрацию приватных данных

Publication Details
Publication Date
2024-01-01
Journal
Publisher
ISSN
Cited by
94
Access Type
Author Information
Authors
Zhixiang Liang
Qiusi Zhan
Zifan Ying
Daniel Kang
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%