Атаки с внедрением промптов на приложения, интегрированные с большими языковыми моделями

Prompt Injection attack against LLM-integrated Applications
Yang Liu, Gelei Deng, Yepang Liu, Yuekang Li, Kailong Wang, Tianwei Zhang, Yi Liu, Wang, Zihao, Wang, Xiaofeng, Wang, Haoyu, Yan Zheng, Zhang, Leo Yu
2023-06-08

HouYiприложения, интегрированные с большими языковыми моделямикража промптов приложенияатака типа «черный ящик»атаки с внедрением промптов
Большие языковые модели (LLM), известные своими выдающимися возможностями понимания и генерации текста, стимулировали формирование динамично развивающейся экосистемы приложений на их основе. Однако их широкая интеграция в различные сервисы создает существенные риски для безопасности. В данном исследовании подробно рассматриваются сложность и последствия атак с внедрением промптов на реальные приложения, интегрированные с LLM. Сначала мы проводим поисковый анализ десяти коммерческих приложений, выявляя ограничения существующих стратегий атак на практике. С учетом этих ограничений мы разрабатываем HouYi — новый метод атаки с внедрением промптов методом «черного ящика», вдохновленный традиционными атаками с внедрением в веб-приложения. Метод HouYi включает три ключевых элемента: предварительно сконструированный промпт, бесшовно интегрируемый в приложение; инъекционный промпт, вызывающий разделение контекста; и вредоносную полезную нагрузку, предназначенную для достижения целей атаки. С помощью HouYi мы выявляем ранее неизвестные и серьезные последствия атак, включая неограниченное произвольное использование LLM и простой доступ к промптам приложения с целью их хищения. Мы применяем HouYi к 36 реальным приложениям, интегрированным с LLM, и устанавливаем, что 31 из них уязвимо к внедрению промптов. Десять поставщиков подтвердили наши результаты, включая Notion, потенциально затрагивающий миллионы пользователей. Наше исследование демонстрирует как потенциальные риски атак с внедрением промптов, так и возможные стратегии их предотвращения.
1
Исследование десяти коммерческих приложений с интегрированными LLM выявило практические ограничения существующих стратегий атак с внедрением подсказок.
2
HouYi обеспечивает серьёзные последствия атак, включая неограниченное произвольное использование LLM и простой захват подсказок приложения.
3
Предложен HouYi — чёрный ящик-метод внедрения подсказок, объединяющий заранее подготовленную подсказку, инъекционную подсказку для разделения контекста и вредоносную полезную нагрузку.
4
Десять поставщиков подтвердили обнаруженные уязвимости, включая Notion, что потенциально затрагивает миллионы пользователей; также рассматриваются меры противодействия.
5
Тестирование 36 реальных приложений с интегрированными LLM показало, что 31 из них уязвимо к атакам с внедрением подсказок.

реальные приложения, интегрированные с большими языковыми моделями (LLM)

уязвимость этих приложений к атакам с внедрением промптов и связанные с ними последствия для безопасности

Publication Details
Publication Date
2023-06-08
Journal
Publisher
ISSN
Cited by
84
Access Type
Author Information
Authors
Yang Liu
Gelei Deng
Yepang Liu
Yuekang Li
Kailong Wang
Tianwei Zhang
Yi Liu
Wang, Zihao
Wang, Xiaofeng
Wang, Haoyu
Yan Zheng
Zhang, Leo Yu
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%