Атаки с внедрением промптов на приложения, интегрированные с большими языковыми моделями
Prompt Injection attack against LLM-integrated Applications
2023-06-08
SCID: 54.1/fbujx5yy
Discuss with AI
HouYiприложения, интегрированные с большими языковыми моделямикража промптов приложенияатака типа «черный ящик»атаки с внедрением промптов
Figures from the paper
Abstract (AI)
Большие языковые модели (LLM), известные своими выдающимися возможностями понимания и генерации текста, стимулировали формирование динамично развивающейся экосистемы приложений на их основе. Однако их широкая интеграция в различные сервисы создает существенные риски для безопасности. В данном исследовании подробно рассматриваются сложность и последствия атак с внедрением промптов на реальные приложения, интегрированные с LLM. Сначала мы проводим поисковый анализ десяти коммерческих приложений, выявляя ограничения существующих стратегий атак на практике. С учетом этих ограничений мы разрабатываем HouYi — новый метод атаки с внедрением промптов методом «черного ящика», вдохновленный традиционными атаками с внедрением в веб-приложения. Метод HouYi включает три ключевых элемента: предварительно сконструированный промпт, бесшовно интегрируемый в приложение; инъекционный промпт, вызывающий разделение контекста; и вредоносную полезную нагрузку, предназначенную для достижения целей атаки. С помощью HouYi мы выявляем ранее неизвестные и серьезные последствия атак, включая неограниченное произвольное использование LLM и простой доступ к промптам приложения с целью их хищения. Мы применяем HouYi к 36 реальным приложениям, интегрированным с LLM, и устанавливаем, что 31 из них уязвимо к внедрению промптов. Десять поставщиков подтвердили наши результаты, включая Notion, потенциально затрагивающий миллионы пользователей. Наше исследование демонстрирует как потенциальные риски атак с внедрением промптов, так и возможные стратегии их предотвращения.
Key Findings
1
Исследование десяти коммерческих приложений с интегрированными LLM выявило практические ограничения существующих стратегий атак с внедрением подсказок.
2
HouYi обеспечивает серьёзные последствия атак, включая неограниченное произвольное использование LLM и простой захват подсказок приложения.
3
Предложен HouYi — чёрный ящик-метод внедрения подсказок, объединяющий заранее подготовленную подсказку, инъекционную подсказку для разделения контекста и вредоносную полезную нагрузку.
4
Десять поставщиков подтвердили обнаруженные уязвимости, включая Notion, что потенциально затрагивает миллионы пользователей; также рассматриваются меры противодействия.
5
Тестирование 36 реальных приложений с интегрированными LLM показало, что 31 из них уязвимо к атакам с внедрением подсказок.
Research Object
реальные приложения, интегрированные с большими языковыми моделями (LLM)
Research Subject
уязвимость этих приложений к атакам с внедрением промптов и связанные с ними последствия для безопасности
Publication Details
Publication Date
2023-06-08
Journal
Publisher
ISSN
Cited by
84
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest