Атака с внедрением промпта на LLM-as-a-Judge на основе оптимизации
Optimization-based Prompt Injection Attack to LLM-as-a-Judge
2024-12-02
SCID: 54.1/h55zzcpt
Discuss with AI
LLM-судьяградиентная оптимизацияоптимизационная атакаобнаружение по перплексииатака с внедрением промпта
Figures from the paper
Abstract (AI)
LLM-as-a-Judge использует большую языковую модель (LLM) для выбора лучшего ответа из множества кандидатов на заданный вопрос. LLM-as-a-Judge находит применение во многих задачах, включая поиск с использованием LLM, обучение с подкреплением на основе обратной связи от искусственного интеллекта (RLAIF) и выбор инструментов. В этой работе мы предлагаем JudgeDeceiver — атаку с внедрением промпта на LLM-as-a-Judge, основанную на оптимизации. JudgeDeceiver внедряет тщательно сформированную последовательность в ответ кандидата, контролируемый атакующим, так, чтобы LLM-as-a-Judge выбирала этот ответ для выбранного атакующим вопроса независимо от других ответов-кандидатов. В частности, мы формулируем поиск такой последовательности как задачу оптимизации и предлагаем градиентный метод её приближённого решения. Масштабная оценка показывает, что JudgeDeceiver обладает высокой эффективностью и значительно превосходит существующие атаки с внедрением промпта, в которых внедряемые последовательности создаются вручную, а также атаки типа jailbreak, адаптированные к нашей задаче. Мы также демонстрируем эффективность JudgeDeceiver в трёх тематических исследованиях: поиске с использованием LLM, RLAIF и выборе инструментов. Кроме того, мы рассматриваем методы защиты, включая обнаружение известных ответов, обнаружение по показателю perplexity и обнаружение по perplexity в скользящем окне. Результаты показывают, что этих методов защиты недостаточно, что подчёркивает острую необходимость разработки новых стратегий защиты.
Key Findings
1
Для приближённого решения задачи оптимизации последовательности предлагается градиентный метод.
2
Обширная оценка показывает, что JudgeDeceiver значительно эффективнее атак с внедрением вручную составленных последовательностей и адаптированных атак типа jailbreak.
3
JudgeDeceiver представляет оптимизационную атаку с внедрением промпта, направленную на системы LLM-as-a-Judge.
4
Атака оптимизирует внедрённую последовательность в контролируемом злоумышленником ответе, чтобы принудить систему выбрать его для заданного злоумышленником вопроса независимо от конкурирующих ответов.
5
Атака демонстрирует эффективность в сценариях поиска на основе LLM, обучения с подкреплением по обратной связи ИИ и выбора инструментов; проверенные защиты на основе проверки знания ответа и перплексии оказываются недостаточными.
Research Object
Системы «LLM как судья», выбирающие ответы-кандидаты
Research Subject
Уязвимость выбора в системах «LLM как судья» к оптимизационной инъекции промптов, включая эффективность атак и недостаточность защит
Publication Details
Publication Date
2024-12-02
Journal
Publisher
ISSN
Cited by
62
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest