Атака с внедрением промпта на LLM-as-a-Judge на основе оптимизации

Optimization-based Prompt Injection Attack to LLM-as-a-Judge
Jiawen Shi, Zenghui Yuan, Yinuo Liu, Yue Huang, Pan Zhou, Lichao Sun, Neil Zhenqiang Gong
2024-12-02

LLM-судьяградиентная оптимизацияоптимизационная атакаобнаружение по перплексииатака с внедрением промпта
LLM-as-a-Judge использует большую языковую модель (LLM) для выбора лучшего ответа из множества кандидатов на заданный вопрос. LLM-as-a-Judge находит применение во многих задачах, включая поиск с использованием LLM, обучение с подкреплением на основе обратной связи от искусственного интеллекта (RLAIF) и выбор инструментов. В этой работе мы предлагаем JudgeDeceiver — атаку с внедрением промпта на LLM-as-a-Judge, основанную на оптимизации. JudgeDeceiver внедряет тщательно сформированную последовательность в ответ кандидата, контролируемый атакующим, так, чтобы LLM-as-a-Judge выбирала этот ответ для выбранного атакующим вопроса независимо от других ответов-кандидатов. В частности, мы формулируем поиск такой последовательности как задачу оптимизации и предлагаем градиентный метод её приближённого решения. Масштабная оценка показывает, что JudgeDeceiver обладает высокой эффективностью и значительно превосходит существующие атаки с внедрением промпта, в которых внедряемые последовательности создаются вручную, а также атаки типа jailbreak, адаптированные к нашей задаче. Мы также демонстрируем эффективность JudgeDeceiver в трёх тематических исследованиях: поиске с использованием LLM, RLAIF и выборе инструментов. Кроме того, мы рассматриваем методы защиты, включая обнаружение известных ответов, обнаружение по показателю perplexity и обнаружение по perplexity в скользящем окне. Результаты показывают, что этих методов защиты недостаточно, что подчёркивает острую необходимость разработки новых стратегий защиты.
1
Для приближённого решения задачи оптимизации последовательности предлагается градиентный метод.
2
Обширная оценка показывает, что JudgeDeceiver значительно эффективнее атак с внедрением вручную составленных последовательностей и адаптированных атак типа jailbreak.
3
JudgeDeceiver представляет оптимизационную атаку с внедрением промпта, направленную на системы LLM-as-a-Judge.
4
Атака оптимизирует внедрённую последовательность в контролируемом злоумышленником ответе, чтобы принудить систему выбрать его для заданного злоумышленником вопроса независимо от конкурирующих ответов.
5
Атака демонстрирует эффективность в сценариях поиска на основе LLM, обучения с подкреплением по обратной связи ИИ и выбора инструментов; проверенные защиты на основе проверки знания ответа и перплексии оказываются недостаточными.

Системы «LLM как судья», выбирающие ответы-кандидаты

Уязвимость выбора в системах «LLM как судья» к оптимизационной инъекции промптов, включая эффективность атак и недостаточность защит

Publication Details
Publication Date
2024-12-02
Journal
Publisher
ISSN
Cited by
62
Access Type
Author Information
Authors
Jiawen Shi
Zenghui Yuan
Yinuo Liu
Yue Huang
Pan Zhou
Lichao Sun
Neil Zhenqiang Gong
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%