Не то, на что вы подписывались: компрометация реальных приложений, интегрированных с большими языковыми моделями, с помощью косвенного внедрения промптов
Not What You've Signed Up For: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection
2023-11-21
SCID: 54.1/fexpaqar
Discuss with AI
приложения, интегрированные с большими языковыми моделямипроизвольное выполнение кодакража данныхкосвенная инъекция промптовзагрязнение информационной экосистемы
Figures from the paper
Abstract (AI)
Большие языковые модели (LLM) все чаще интегрируются в приложения, обеспечивая универсальные функциональные возможности, которые можно легко модифицировать с помощью запросов на естественном языке. До сих пор предполагалось, что запросы к LLM непосредственно формирует пользователь. Но что, если запросы формирует не пользователь? Мы показываем, что приложения, интегрированные с LLM, размывают границу между данными и инструкциями и выявляют несколько новых векторов атак, использующих косвенное внедрение промптов, которые позволяют злоумышленникам удаленно (то есть без непосредственного доступа к интерфейсу) эксплуатировать такие приложения путем стратегического внедрения запросов в данные, которые, вероятно, будут извлечены во время вывода. С позиций компьютерной безопасности мы разрабатываем всеобъемлющую таксономию для систематического исследования последствий и уязвимостей, включая кражу данных, распространение червеобразных атак, загрязнение информационной экосистемы и другие новые риски безопасности. Затем мы демонстрируем практическую осуществимость наших атак как на реальных системах, таких как Bing Chat и движках автодополнения кода, так и на синтетических приложениях на основе GPT-4. Мы показываем, как обработка извлеченных запросов может приводить к выполнению произвольного кода, изменять функциональность приложения и управлять тем, вызываются ли другие API и каким образом. Несмотря на растущую зависимость от LLM, эффективные меры защиты от этих возникающих угроз пока отсутствуют. Повышая осведомленность об этих уязвимостях, мы стремимся содействовать безопасному и ответственному развертыванию этих мощных моделей и разработке надежных механизмов защиты, которые предохраняют пользователей от потенциальных атак.
Key Findings
1
Существующие меры защиты характеризуются как неэффективные или недостаточные, несмотря на растущую зависимость от приложений с интегрированными LLM.
2
Практическая реализуемость атак показана на Bing Chat, движках автодополнения кода и синтетических приложениях на основе GPT-4.
3
Косвенная инъекция промптов позволяет удалённо атаковать приложения с интегрированными LLM, встраивая вредоносные инструкции в данные, извлекаемые во время инференса.
4
Извлечённые промпты могут выполнять роль произвольного выполнения кода, изменять поведение приложения и управлять тем, вызываются ли внешние API и каким образом.
5
Исследование предлагает ориентированную на компьютерную безопасность таксономию последствий, включая кражу данных, самораспространяющиеся атаки, загрязнение информационной экосистемы и другие риски.
Research Object
реальные приложения, интегрированные с большими языковыми моделями (LLM)
Research Subject
уязвимости и последствия для безопасности, вызванные косвенной инъекцией промптов, включая удалённую эксплуатацию, кражу данных, манипулирование функциональностью, произвольное выполнение кода и управление вызовами API
Publication Details
Publication Date
2023-11-21
Journal
Publisher
ISSN
Cited by
519
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest