PoisonedRAG: атаки порчи знаний на генерацию с использованием извлечения для больших языковых моделей

PoisonedRAG: Knowledge Corruption Attacks to Retrieval-Augmented Generation of Large Language Models
Wei Zou, Runpeng Geng, Binghui Wang, Jinyuan Jia
2024-02-12

PoisonedRAGуровень успешности атакиатака на порчу знанийотравление базы знанийretrieval-augmented generation
Большие языковые модели (LLM) достигли заметных успехов благодаря своим выдающимся генеративным возможностям. Несмотря на это, у них есть и присущие ограничения, такие как отсутствие актуальных знаний и галлюцинации. Retrieval-Augmented Generation (RAG) — современная методика для смягчения этих ограничений. Ключевая идея RAG заключается в том, чтобы основывать генерацию ответов LLM на внешних знаниях, извлекаемых из базы знаний. Существующие исследования в основном фокусируются на повышении точности или эффективности RAG, оставляя его безопасность во многом не изученной. В этой работе мы стремимся заполнить этот пробел. Мы выявляем, что база знаний в системе RAG вводит новую и практичную поверхность атаки. Исходя из этой поверхности атаки, мы предлагаем PoisonedRAG — первую атаку порчи знаний на RAG, при которой злоумышленник может внедрить несколько вредоносных текстов в базу знаний системы RAG, чтобы заставить LLM сгенерировать выбранный злоумышленником целевой ответ на выбранный злоумышленником целевой вопрос. Мы формулируем атаки порчи знаний как задачу оптимизации, решение которой представляет собой набор вредоносных текстов. В зависимости от фоновых знаний злоумышленника о системе RAG (например, в условиях «черного ящика» и «белого ящика») мы предлагаем два решения для решения задачи оптимизации соответственно. Наши результаты показывают, что PoisonedRAG может достигать 90% успеха атаки при внедрении пяти вредоносных текстов для каждого целевого вопроса в базу знаний, содержащую миллионы текстов. Мы также оцениваем несколько методов защиты и показываем, что они недостаточны для противодействия PoisonedRAG, что подчёркивает необходимость разработки новых средств защиты.
1
Оценённые существующие средства защиты оказываются недостаточными против PoisonedRAG, что указывает на необходимость новых механизмов защиты для систем RAG.
2
PoisonedRAG достигает 90% успешности атаки при внедрении пяти вредоносных текстов на целевой вопрос в базу знаний, содержащую миллионы текстов.
3
PoisonedRAG — первая предложенная атака по коррумпированию знаний, которая внедряет несколько вредоносных текстов в базу знаний RAG, чтобы вызвать ответы, выбранные злоумышленником, на заданные вопросы.
4
Системы Retrieval-Augmented Generation (RAG) вводят практическую поверхность атаки через свою базу знаний, которую можно использовать для искажения генерируемых ответов.
5
Атака сформулирована как задача оптимизации, решение которой даёт набор вредоносных текстов; предложены два метода решения для разных условий знаний атакующего (black-box и white-box).

База знаний системы Retrieval-Augmented Generation (RAG) и её взаимодействие с большой языковой моделью

Атаки порчи знаний (PoisonedRAG), вставляющие злоумышленные тексты в базу знаний RAG для вызова у большой языковой модели заранее выбранных атакующими ответов, включая формулировку атаки, оптимизационное получение злоумышленных текстов в условиях black-box и white-box, показатели успешности атаки и оценку защитных мер

Publication Details
Publication Date
2024-02-12
Journal
Publisher
ISSN
Cited by
12
Access Type
Author Information
Authors
Wei Zou
Runpeng Geng
Binghui Wang
Jinyuan Jia
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%