Обзор безопасности и конфиденциальности больших языковых моделей (LLM): Хорошее, Плохое и Уродливое

A survey on large language model (LLM) security and privacy: The Good, The Bad, and The Ugly
Yue Zhang, Yifan Yao, Jinhao Duan, Kaidi Xu, Yuanfang Cai, Zhibo Sun
2024-02-29

безопасность и конфиденциальность LLMБольшие языковые модели (LLM)обнаружение уязвимостей в кодезащита конфиденциальности данныхатаки на извлечение модели и параметров
Большие языковые модели (LLM), такие как ChatGPT и Bard, произвели революцию в понимании и генерации естественного языка. Они обладают глубоким пониманием языка, способностью генерировать текст, близкий к человеческому, контекстной осведомлённостью и устойчивыми навыками решения задач, что делает их ценными в различных областях (например, поисковые системы, поддержка клиентов, перевод). В то же время LLM привлекают внимание в сообществе информационной безопасности, выявляя уязвимости и демонстрируя потенциал в задачах, связанных с безопасностью. В данной статье исследуется пересечение LLM с безопасностью и конфиденциальностью. В частности, мы анализируем, как LLM положительно влияют на безопасность и конфиденциальность, какие потенциальные риски и угрозы связаны с их использованием, а также внутренние уязвимости самих LLM. На основе всестороннего обзора литературы работы классифицируются как «Хорошее» (полезные приложения LLM), «Плохое» (офенсивные применения) и «Уродливое» (уязвимости LLM и их защиты). Мы приводим несколько важных результатов. Например, показано, что LLM улучшают безопасность кода (обнаружение уязвимостей в коде) и защиту данных (обеспечение конфиденциальности данных), в некоторых случаях превосходя традиционные методы. Однако LLM также могут использоваться для различных атак (особенно на уровне пользователей) вследствие их способности к рассуждению, похожему на человеческое. Мы выделяем области, требующие дальнейших исследований: например, исследования атак на извлечение моделей и параметров ограничены и часто носят теоретический характер из-за масштаба параметров LLM и конфиденциальности; безопасная настройка инструкций (safe instruction tuning), как относительно новое направление, требует дополнительного изучения. Мы надеемся, что наша работа прояснит, как LLM могут как укреплять, так и ставить под угрозу кибербезопасность.
1
LLM улучшают приватность данных, обеспечивая защиту конфиденциальности данных лучше, чем обычные подходы.
2
LLM продемонстрировали улучшение безопасности кода, например обнаружение уязвимостей в коде, превосходя традиционные методы.
3
LLM могут использоваться в наступательных целях, совершая различные атаки — особенно на уровне пользователей — из‑за человеческого уровня рассуждений.
4
Исследования атак на извлечение модели и параметров ограничены, преимущественно теоретичны и затруднены масштабом и конфиденциальностью LLM.
5
Safe instruction tuning — недавнее направление, которое остаётся малоизученным и требует дополнительных исследований.
6
В LLM существуют присущие уязвимости, требующие защитных мер, что оправдывает категоризацию работы на полезные, вредоносные и исследующие уязвимости направления.

Большие языковые модели (LLM)

Аспекты безопасности и конфиденциальности LLM, включая полезные приложения в области безопасности/конфиденциальности, наступательные использования и векторы атак, присущие уязвимости и методы защиты

Publication Details
Publication Date
2024-02-29
Journal
Publisher
ISSN
Cited by
1001
Access Type
Author Information
Authors
Yue Zhang
Yifan Yao
Jinhao Duan
Kaidi Xu
Yuanfang Cai
Zhibo Sun
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%