CPA-RAG: Скрытые атаки отравления на генерацию с дополнением извлечением в больших языковых моделях

CPA-RAG:Covert Poisoning Attacks on Retrieval-Augmented Generation in Large Language Models
Chunyang Li, Junwei Zhang, Anda Cheng, Zhuo Ma, Xinghua Li, Jianfeng Ma
2025-05-26

CPA-RAGчерный ящик (black-box) атакующий фреймворкскрытые атаки отравленияскрест-управляемая оптимизацияretrieval-augmented generation
Генерация с дополнением извлечением (Retrieval-Augmented Generation, RAG) расширяет возможности больших языковых моделей (LLM) за счёт использования внешних знаний, однако её открытость создаёт уязвимости, которые могут эксплуатироваться с помощью атак отравления. Существующие методы отравления RAG-систем имеют ограничения, включая низкую способность к обобщению и недостаточную беглость состязательных текстов. В данной работе предлагается CPA-RAG — состязательная чёрнояпонная структура, генерирующая релевантные запросу тексты, способные манипулировать процессом извлечения для получения целевых ответов. Предлагаемый метод объединяет генерацию текста на основе подсказок, перекрёстно направляемую оптимизацию с использованием нескольких LLM и оценивание на основе модуля извлечения для формирования высококачественных состязательных примеров. Для оценки эффективности метода проведена серия масштабных экспериментов на нескольких наборах данных и LLM. Результаты показывают, что при значении top-k, равном 5, структура обеспечивает успешность атак свыше 90%, сопоставимую с результатами методов «белого ящика», и сохраняет стабильное преимущество примерно в 5 процентных пунктов при различных значениях top-k. Кроме того, при использовании различных стратегий защиты она превосходит существующие чёрнояпонные базовые методы на 14,5 процентного пункта. Предложенный метод также успешно компрометирует коммерческую RAG-систему, развернутую на платформе BaiLian компании Alibaba, что демонстрирует практическую угрозу метода для приложений реального мира. Полученные результаты подчёркивают необходимость разработки более устойчивых и безопасных RAG-структур для защиты от атак отравления.
1
На нескольких наборах данных и LLM CPA-RAG достигает более 90% успешности атаки при top-k = 5, соответствуя производительности white-box методов.
2
CPA-RAG сочетает порождающие подсказки методы, кросс-направляемую оптимизацию через несколько LLM и оценку на основе ретривера для создания качественных вредоносных примеров.
3
CPA-RAG — это чернобоксная враждебная схема, генерирующая релевантные запросу тексты для манипуляции извлечением в RAG и навязывания целевых ответов.
4
CPA-RAG сохраняет примерно 5 процентных пунктов преимущества в успешности атак при различных значениях top-k по сравнению с альтернативами.
5
CPA-RAG превосходит существующие black-box базовые методы на 14,5 процентных пункта при различных стратегиях защиты.
6
CPA-RAG успешно компрометирует коммерческую RAG-систему на платформе BaiLian от Alibaba, демонстрируя практическую угрозу в реальном мире.
7
Результаты указывают на необходимость более надёжных защит в RAG-фреймворках для противодействия скрытым атакам отравления, таким как CPA-RAG.

Системы Retrieval-Augmented Generation (RAG) для больших языковых моделей, включая ретривер и внешний корпус знаний

Скрытые отравляющие атаки, генерирующие релевантные запросу вредоносные тексты для манипуляции процессом поиска и навязывания целевых ответов, а также эффективность таких атак против RAG при различных настройках top-k и защитных мерах

Publication Details
Publication Date
2025-05-26
Journal
Publisher
ISSN
Cited by
0
Access Type
Author Information
Authors
Chunyang Li
Junwei Zhang
Anda Cheng
Zhuo Ma
Xinghua Li
Jianfeng Ma
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%