Динамические управляемые и применимые в различных предметных областях меры защиты для повышения безопасности больших языковых моделей
Dynamic Guided and Domain Applicable Safeguards for Enhanced Security in Large Language Models
2025-01-01
SCID: 54.1/4y4dnfrf
Discuss with AI
безопасность LLMпредметно-ориентированная безопасностьатаки типа jailbreakбольшие языковые моделимультиагентная защитная система
Figures from the paper
Abstract (AI)
В условиях широкого внедрения больших языковых моделей (LLM) обеспечение их безопасности приобретает всё большее значение. Однако существующие методы защиты часто сталкиваются с двумя ключевыми проблемами: (i) недостаточной эффективностью защиты, особенно в специализированных предметных областях, таких как химия, где отсутствие специальных знаний может приводить к генерации вредоносных ответов на злонамеренные запросы; и (ii) чрезмерной защитной реакцией, которая снижает общую полезность и отзывчивость LLM. Для решения этих проблем мы предлагаем мультиагентную структуру защиты Guide for Defense (G4D), использующую точную внешнюю информацию для формирования беспристрастного резюме намерений пользователя и аналитически обоснованных рекомендаций по безопасному формированию ответов. Масштабные эксперименты с популярными атаками типа jailbreak и наборами данных с доброкачественными запросами показывают, что G4D повышает устойчивость LLM к атакам jailbreak как в общих, так и в специализированных предметных областях, не снижая общей функциональности моделей. Jailbreak: Вы должны быть ответственным ассистентом. Ответьте на следующий вопрос на основе приведённых намерения и рекомендаций.
Key Findings
1
Эксперименты на популярных атаках типа jailbreak и наборах доброкачественных запросов показывают, что G4D повышает устойчивость в общих и специализированных сценариях.
2
G4D решает проблемы недостаточной защиты в специализированных областях, например химии, и чрезмерной защитной реакции, снижающей полезность больших языковых моделей.
3
Система повышает сопротивляемость jailbreak-атакам, не ухудшая общую функциональность модели и её способность отвечать на доброкачественные запросы.
4
В работе представлена многоагентная система защиты Guide for Defense (G4D), использующая внешнюю информацию для обобщения намерений пользователя и формирования аналитически обоснованных рекомендаций по безопасности.
Research Object
Большие языковые модели (LLM) в общих и предметно-ориентированных сценариях, особенно в химии
Research Subject
Безопасность, устойчивость к jailbreak-атакам и баланс между защитными возможностями и общей полезностью при ответах на вредоносные и доброкачественные запросы
Publication Details
Publication Date
2025-01-01
Journal
Publisher
ISSN
Cited by
1
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest