Обзор безопасности и конфиденциальности больших языковых моделей (LLM): Хорошее, Плохое и Уродливое
A survey on large language model (LLM) security and privacy: The Good, The Bad, and The Ugly
2024-02-29
SCID: 54.1/gg5c598t
Discuss with AI
безопасность и конфиденциальность LLMБольшие языковые модели (LLM)обнаружение уязвимостей в кодезащита конфиденциальности данныхатаки на извлечение модели и параметров
Figures from the paper
Abstract (AI)
Большие языковые модели (LLM), такие как ChatGPT и Bard, произвели революцию в понимании и генерации естественного языка. Они обладают глубоким пониманием языка, способностью генерировать текст, близкий к человеческому, контекстной осведомлённостью и устойчивыми навыками решения задач, что делает их ценными в различных областях (например, поисковые системы, поддержка клиентов, перевод). В то же время LLM привлекают внимание в сообществе информационной безопасности, выявляя уязвимости и демонстрируя потенциал в задачах, связанных с безопасностью. В данной статье исследуется пересечение LLM с безопасностью и конфиденциальностью. В частности, мы анализируем, как LLM положительно влияют на безопасность и конфиденциальность, какие потенциальные риски и угрозы связаны с их использованием, а также внутренние уязвимости самих LLM. На основе всестороннего обзора литературы работы классифицируются как «Хорошее» (полезные приложения LLM), «Плохое» (офенсивные применения) и «Уродливое» (уязвимости LLM и их защиты). Мы приводим несколько важных результатов. Например, показано, что LLM улучшают безопасность кода (обнаружение уязвимостей в коде) и защиту данных (обеспечение конфиденциальности данных), в некоторых случаях превосходя традиционные методы. Однако LLM также могут использоваться для различных атак (особенно на уровне пользователей) вследствие их способности к рассуждению, похожему на человеческое. Мы выделяем области, требующие дальнейших исследований: например, исследования атак на извлечение моделей и параметров ограничены и часто носят теоретический характер из-за масштаба параметров LLM и конфиденциальности; безопасная настройка инструкций (safe instruction tuning), как относительно новое направление, требует дополнительного изучения. Мы надеемся, что наша работа прояснит, как LLM могут как укреплять, так и ставить под угрозу кибербезопасность.
Key Findings
1
LLM улучшают приватность данных, обеспечивая защиту конфиденциальности данных лучше, чем обычные подходы.
2
LLM продемонстрировали улучшение безопасности кода, например обнаружение уязвимостей в коде, превосходя традиционные методы.
3
LLM могут использоваться в наступательных целях, совершая различные атаки — особенно на уровне пользователей — из‑за человеческого уровня рассуждений.
4
Исследования атак на извлечение модели и параметров ограничены, преимущественно теоретичны и затруднены масштабом и конфиденциальностью LLM.
5
Safe instruction tuning — недавнее направление, которое остаётся малоизученным и требует дополнительных исследований.
6
В LLM существуют присущие уязвимости, требующие защитных мер, что оправдывает категоризацию работы на полезные, вредоносные и исследующие уязвимости направления.
Research Object
Большие языковые модели (LLM)
Research Subject
Аспекты безопасности и конфиденциальности LLM, включая полезные приложения в области безопасности/конфиденциальности, наступательные использования и векторы атак, присущие уязвимости и методы защиты
Publication Details
Publication Date
2024-02-29
Journal
Publisher
ISSN
Cited by
1001
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai20
Фреймворк Aion: размерное возникновение сознания ИИ, коллапс под воздействием наблюдателя и динамика космологических порталов2023
Обучение языковых моделей следованию инструкциям с использованием обратной связи от человека2022
Материалы конференции 2021 года по эмпирическим методам обработки естественного языка2021
Обзор больших языковых моделей2026
Будущий ландшафт больших языковых моделей в медицине2023
ChatGPT для образования и научных исследований: возможности, угрозы и стратегии2023
Большие языковые модели для программной инженерии: систематический обзор литературы2024
ChatGPT в высшем образовании: вопросы академической добросовестности и обучения студентов2023
Вопросы академической добросовестности при использовании больших языковых моделей в постпандемическую эпоху: ChatGPT и далее2023
От ChatGPT к ThreatGPT: влияние генеративного искусственного интеллекта на кибербезопасность и конфиденциальность2023
Общение и списывание: обеспечение академической добросовестности в эпоху ChatGPT2023
Сравнение научных аннотаций, сгенерированных ChatGPT, с оригинальными аннотациями с использованием детектора AI-выхода, детектора плагиата и слепых рецензентов2022
BloombergGPT: большая языковая модель для финансов2023
BLOOM: многоязычная открытая языковая модель с 176 миллиардами параметров2022
Поймает ли вас ChatGPT? Переосмысление выявления плагиата2023
Борьба с дезинформацией в эпоху больших языковых моделей: возможности и вызовы2024
Атаки с внедрением промптов на приложения, интегрированные с большими языковыми моделями2023
HuntGPT: интеграция обнаружения аномалий на основе машинного обучения и объяснимого искусственного интеллекта с большими языковыми моделями (LLM)2026
Исследование пределов переносного обучения с унифицированным трансформером «текст-в-текст»2019
Пайплайн с поддержкой ИИ для динамической генерации достоверного контента о биологически активных добавках в масштабе2018