Не то, на что вы подписывались: компрометация реальных приложений, интегрированных с большими языковыми моделями, с помощью косвенного внедрения промптов

Not What You've Signed Up For: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection
Kai Greshake, Sahar Abdelnabi, Shailesh Mishra, Christoph Endres, Thorsten Holz, Mario Fritz
2023-11-21

приложения, интегрированные с большими языковыми моделямипроизвольное выполнение кодакража данныхкосвенная инъекция промптовзагрязнение информационной экосистемы
Большие языковые модели (LLM) все чаще интегрируются в приложения, обеспечивая универсальные функциональные возможности, которые можно легко модифицировать с помощью запросов на естественном языке. До сих пор предполагалось, что запросы к LLM непосредственно формирует пользователь. Но что, если запросы формирует не пользователь? Мы показываем, что приложения, интегрированные с LLM, размывают границу между данными и инструкциями и выявляют несколько новых векторов атак, использующих косвенное внедрение промптов, которые позволяют злоумышленникам удаленно (то есть без непосредственного доступа к интерфейсу) эксплуатировать такие приложения путем стратегического внедрения запросов в данные, которые, вероятно, будут извлечены во время вывода. С позиций компьютерной безопасности мы разрабатываем всеобъемлющую таксономию для систематического исследования последствий и уязвимостей, включая кражу данных, распространение червеобразных атак, загрязнение информационной экосистемы и другие новые риски безопасности. Затем мы демонстрируем практическую осуществимость наших атак как на реальных системах, таких как Bing Chat и движках автодополнения кода, так и на синтетических приложениях на основе GPT-4. Мы показываем, как обработка извлеченных запросов может приводить к выполнению произвольного кода, изменять функциональность приложения и управлять тем, вызываются ли другие API и каким образом. Несмотря на растущую зависимость от LLM, эффективные меры защиты от этих возникающих угроз пока отсутствуют. Повышая осведомленность об этих уязвимостях, мы стремимся содействовать безопасному и ответственному развертыванию этих мощных моделей и разработке надежных механизмов защиты, которые предохраняют пользователей от потенциальных атак.
1
Существующие меры защиты характеризуются как неэффективные или недостаточные, несмотря на растущую зависимость от приложений с интегрированными LLM.
2
Практическая реализуемость атак показана на Bing Chat, движках автодополнения кода и синтетических приложениях на основе GPT-4.
3
Косвенная инъекция промптов позволяет удалённо атаковать приложения с интегрированными LLM, встраивая вредоносные инструкции в данные, извлекаемые во время инференса.
4
Извлечённые промпты могут выполнять роль произвольного выполнения кода, изменять поведение приложения и управлять тем, вызываются ли внешние API и каким образом.
5
Исследование предлагает ориентированную на компьютерную безопасность таксономию последствий, включая кражу данных, самораспространяющиеся атаки, загрязнение информационной экосистемы и другие риски.

реальные приложения, интегрированные с большими языковыми моделями (LLM)

уязвимости и последствия для безопасности, вызванные косвенной инъекцией промптов, включая удалённую эксплуатацию, кражу данных, манипулирование функциональностью, произвольное выполнение кода и управление вызовами API

Publication Details
Publication Date
2023-11-21
Journal
Publisher
ISSN
Cited by
519
Access Type
Author Information
Authors
Kai Greshake
Sahar Abdelnabi
Shailesh Mishra
Christoph Endres
Thorsten Holz
Mario Fritz
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%