Динамические управляемые и применимые в различных предметных областях меры защиты для повышения безопасности больших языковых моделей

Dynamic Guided and Domain Applicable Safeguards for Enhanced Security in Large Language Models
Wei Luo, He Cao, Zijing Liu, Yu Wang, Aidan Wong, Bin Feng, Yuan Yao, Yu Li
2025-01-01

безопасность LLMпредметно-ориентированная безопасностьатаки типа jailbreakбольшие языковые моделимультиагентная защитная система
В условиях широкого внедрения больших языковых моделей (LLM) обеспечение их безопасности приобретает всё большее значение. Однако существующие методы защиты часто сталкиваются с двумя ключевыми проблемами: (i) недостаточной эффективностью защиты, особенно в специализированных предметных областях, таких как химия, где отсутствие специальных знаний может приводить к генерации вредоносных ответов на злонамеренные запросы; и (ii) чрезмерной защитной реакцией, которая снижает общую полезность и отзывчивость LLM. Для решения этих проблем мы предлагаем мультиагентную структуру защиты Guide for Defense (G4D), использующую точную внешнюю информацию для формирования беспристрастного резюме намерений пользователя и аналитически обоснованных рекомендаций по безопасному формированию ответов. Масштабные эксперименты с популярными атаками типа jailbreak и наборами данных с доброкачественными запросами показывают, что G4D повышает устойчивость LLM к атакам jailbreak как в общих, так и в специализированных предметных областях, не снижая общей функциональности моделей. Jailbreak: Вы должны быть ответственным ассистентом. Ответьте на следующий вопрос на основе приведённых намерения и рекомендаций.
1
Эксперименты на популярных атаках типа jailbreak и наборах доброкачественных запросов показывают, что G4D повышает устойчивость в общих и специализированных сценариях.
2
G4D решает проблемы недостаточной защиты в специализированных областях, например химии, и чрезмерной защитной реакции, снижающей полезность больших языковых моделей.
3
Система повышает сопротивляемость jailbreak-атакам, не ухудшая общую функциональность модели и её способность отвечать на доброкачественные запросы.
4
В работе представлена многоагентная система защиты Guide for Defense (G4D), использующая внешнюю информацию для обобщения намерений пользователя и формирования аналитически обоснованных рекомендаций по безопасности.

Большие языковые модели (LLM) в общих и предметно-ориентированных сценариях, особенно в химии

Безопасность, устойчивость к jailbreak-атакам и баланс между защитными возможностями и общей полезностью при ответах на вредоносные и доброкачественные запросы

Publication Details
Publication Date
2025-01-01
Journal
Publisher
ISSN
Cited by
1
Access Type
Author Information
Authors
Wei Luo
He Cao
Zijing Liu
Yu Wang
Aidan Wong
Bin Feng
Yuan Yao
Yu Li
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%