PoisonedRAG: атаки порчи знаний на генерацию с использованием извлечения для больших языковых моделей
PoisonedRAG: Knowledge Corruption Attacks to Retrieval-Augmented Generation of Large Language Models
2024-02-12
SCID: 54.1/rd9n2day
Discuss with AI
PoisonedRAGуровень успешности атакиатака на порчу знанийотравление базы знанийretrieval-augmented generation
Figures from the paper
Abstract (AI)
Большие языковые модели (LLM) достигли заметных успехов благодаря своим выдающимся генеративным возможностям. Несмотря на это, у них есть и присущие ограничения, такие как отсутствие актуальных знаний и галлюцинации. Retrieval-Augmented Generation (RAG) — современная методика для смягчения этих ограничений. Ключевая идея RAG заключается в том, чтобы основывать генерацию ответов LLM на внешних знаниях, извлекаемых из базы знаний. Существующие исследования в основном фокусируются на повышении точности или эффективности RAG, оставляя его безопасность во многом не изученной. В этой работе мы стремимся заполнить этот пробел. Мы выявляем, что база знаний в системе RAG вводит новую и практичную поверхность атаки. Исходя из этой поверхности атаки, мы предлагаем PoisonedRAG — первую атаку порчи знаний на RAG, при которой злоумышленник может внедрить несколько вредоносных текстов в базу знаний системы RAG, чтобы заставить LLM сгенерировать выбранный злоумышленником целевой ответ на выбранный злоумышленником целевой вопрос. Мы формулируем атаки порчи знаний как задачу оптимизации, решение которой представляет собой набор вредоносных текстов. В зависимости от фоновых знаний злоумышленника о системе RAG (например, в условиях «черного ящика» и «белого ящика») мы предлагаем два решения для решения задачи оптимизации соответственно. Наши результаты показывают, что PoisonedRAG может достигать 90% успеха атаки при внедрении пяти вредоносных текстов для каждого целевого вопроса в базу знаний, содержащую миллионы текстов. Мы также оцениваем несколько методов защиты и показываем, что они недостаточны для противодействия PoisonedRAG, что подчёркивает необходимость разработки новых средств защиты.
Key Findings
1
Оценённые существующие средства защиты оказываются недостаточными против PoisonedRAG, что указывает на необходимость новых механизмов защиты для систем RAG.
2
PoisonedRAG достигает 90% успешности атаки при внедрении пяти вредоносных текстов на целевой вопрос в базу знаний, содержащую миллионы текстов.
3
PoisonedRAG — первая предложенная атака по коррумпированию знаний, которая внедряет несколько вредоносных текстов в базу знаний RAG, чтобы вызвать ответы, выбранные злоумышленником, на заданные вопросы.
4
Системы Retrieval-Augmented Generation (RAG) вводят практическую поверхность атаки через свою базу знаний, которую можно использовать для искажения генерируемых ответов.
5
Атака сформулирована как задача оптимизации, решение которой даёт набор вредоносных текстов; предложены два метода решения для разных условий знаний атакующего (black-box и white-box).
Research Object
База знаний системы Retrieval-Augmented Generation (RAG) и её взаимодействие с большой языковой моделью
Research Subject
Атаки порчи знаний (PoisonedRAG), вставляющие злоумышленные тексты в базу знаний RAG для вызова у большой языковой модели заранее выбранных атакующими ответов, включая формулировку атаки, оптимизационное получение злоумышленных текстов в условиях black-box и white-box, показатели успешности атаки и оценку защитных мер
Publication Details
Publication Date
2024-02-12
Journal
Publisher
ISSN
Cited by
12
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest