SafeScientist: к выявлению научных открытий с учетом рисков при использовании агентов LLM

SafeScientist: Toward Risk-Aware Scientific Discoveries by LLM Agents
Kunlun Zhu, Jiaxun Zhang, Ziheng Qi, Shang, Nuoxing, Zijia Liu, Han, Peixuan, Yue Su, Haofei Yu, Jiaxuan You
2025-05-29

рамочная система AI-ученогоагенты LLMSafeScientistSciSafetyBenchустойчивость к адвёрсариальным атакаммониторинг сотрудничества агентовэтический рецензентнаучные задачи с высоким рискоммониторинг подсказокпоток обеспечения безопасностизадачи риска, связанные с инструментамимониторинг использования инструментов
Последние достижения в области агентов на базе больших языковых моделей (LLM) значительно ускорили автоматизацию научных открытий, но одновременно вызвали серьёзные этические и безопасностные проблемы. Для системного решения этих задач мы представляем SafeScientist — фреймворк AI-учёного, специально разработанный для повышения безопасности и этической ответственности в управляемых ИИ научных исследованиях. SafeScientist проактивно отказывает в выполнении этически неприемлемых или высокорисковых задач и делает акцент на безопасности на всех этапах исследовательского процесса. Для достижения всестороннего контроля безопасности мы интегрируем несколько защитных механизмов, включая мониторинг подсказок, мониторинг сотрудничества агентов, мониторинг использования инструментов и компонент этического рецензирования. В дополнение к SafeScientist мы предлагаем SciSafetyBench — бенчмарк, специально разработанный для оценки безопасности ИИ в научных контекстах, включающий 240 высокорисковых научных задач в шести областях, а также 30 специально разработанных научных инструментов и 120 задач, связанных с рисками использования инструментов. Обширные эксперименты показывают, что SafeScientist улучшает показатели безопасности на 35% по сравнению с традиционными фреймворками AI-учёных, не ухудшая качества научных результатов. Дополнительно мы проверяем устойчивость нашей конвейерной системы безопасности к различным методам адвесариальных атак, что дополнительно подтверждает эффективность нашего интегрированного подхода. Код и данные будут доступны по адресу https://github.com/ulab-uiuc/SafeScientist. Внимание: в статье содержатся примерные данные, которые могут быть оскорбительными или вредными.
1
SafeScientist улучшает показатели безопасности на 35% по сравнению с традиционными фреймворками AI-учёных при сохранении качества научных результатов.
2
SafeScientist интегрирует несколько защитных механизмов: мониторинг подсказок, мониторинг взаимодействия агентов, мониторинг использования инструментов и компонент этического рецензирования.
3
SafeScientist — это фреймворк AI-учёного, который проактивно отказывается от этически неподходящих или высокорисковых научных задач.
4
SciSafetyBench — новый бенчмарк с 240 высокорисковыми научными задачами в 6 доменах, 30 научными инструментами и 120 задачами, связанными с риском инструментов, для оценки безопасности ИИ в науке.
5
Пайплайн безопасности SafeScientist устойчив к различным методам атак-оппонентов, что подтверждает эффективность интегрированного подхода.

Фреймворк AI-учёного SafeScientist для проведения научных открытий с учётом рисков (включая защитные компоненты: мониторинг подсказок, мониторинг взаимодействия агентов, мониторинг использования инструментов и компонент этического рецензирования)

Повышение безопасности и этической ответственности в управляемых ИИ научных исследованиях путём выявления/отказа от высокорисковых или неэтичных задач и интеграции многоуровневых защитных механизмов, оценённых с помощью бенчмарка SciSafetyBench и тестов на устойчивость к adversarial-атакам

Publication Details
Publication Date
2025-05-29
Journal
Publisher
ISSN
Cited by
1
Access Type
Author Information
Authors
Kunlun Zhu
Jiaxun Zhang
Ziheng Qi
Shang, Nuoxing
Zijia Liu
Han, Peixuan
Yue Su
Haofei Yu
Jiaxuan You
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%