SafeScientist: к выявлению научных открытий с учетом рисков при использовании агентов LLM
SafeScientist: Toward Risk-Aware Scientific Discoveries by LLM Agents
2025-05-29
SCID: 54.1/vrv63j3b
Discuss with AI
рамочная система AI-ученогоагенты LLMSafeScientistSciSafetyBenchустойчивость к адвёрсариальным атакаммониторинг сотрудничества агентовэтический рецензентнаучные задачи с высоким рискоммониторинг подсказокпоток обеспечения безопасностизадачи риска, связанные с инструментамимониторинг использования инструментов
Figures from the paper
Abstract (AI)
Последние достижения в области агентов на базе больших языковых моделей (LLM) значительно ускорили автоматизацию научных открытий, но одновременно вызвали серьёзные этические и безопасностные проблемы. Для системного решения этих задач мы представляем SafeScientist — фреймворк AI-учёного, специально разработанный для повышения безопасности и этической ответственности в управляемых ИИ научных исследованиях. SafeScientist проактивно отказывает в выполнении этически неприемлемых или высокорисковых задач и делает акцент на безопасности на всех этапах исследовательского процесса. Для достижения всестороннего контроля безопасности мы интегрируем несколько защитных механизмов, включая мониторинг подсказок, мониторинг сотрудничества агентов, мониторинг использования инструментов и компонент этического рецензирования. В дополнение к SafeScientist мы предлагаем SciSafetyBench — бенчмарк, специально разработанный для оценки безопасности ИИ в научных контекстах, включающий 240 высокорисковых научных задач в шести областях, а также 30 специально разработанных научных инструментов и 120 задач, связанных с рисками использования инструментов. Обширные эксперименты показывают, что SafeScientist улучшает показатели безопасности на 35% по сравнению с традиционными фреймворками AI-учёных, не ухудшая качества научных результатов. Дополнительно мы проверяем устойчивость нашей конвейерной системы безопасности к различным методам адвесариальных атак, что дополнительно подтверждает эффективность нашего интегрированного подхода. Код и данные будут доступны по адресу https://github.com/ulab-uiuc/SafeScientist. Внимание: в статье содержатся примерные данные, которые могут быть оскорбительными или вредными.
Key Findings
1
SafeScientist улучшает показатели безопасности на 35% по сравнению с традиционными фреймворками AI-учёных при сохранении качества научных результатов.
2
SafeScientist интегрирует несколько защитных механизмов: мониторинг подсказок, мониторинг взаимодействия агентов, мониторинг использования инструментов и компонент этического рецензирования.
3
SafeScientist — это фреймворк AI-учёного, который проактивно отказывается от этически неподходящих или высокорисковых научных задач.
4
SciSafetyBench — новый бенчмарк с 240 высокорисковыми научными задачами в 6 доменах, 30 научными инструментами и 120 задачами, связанными с риском инструментов, для оценки безопасности ИИ в науке.
5
Пайплайн безопасности SafeScientist устойчив к различным методам атак-оппонентов, что подтверждает эффективность интегрированного подхода.
Research Object
Фреймворк AI-учёного SafeScientist для проведения научных открытий с учётом рисков (включая защитные компоненты: мониторинг подсказок, мониторинг взаимодействия агентов, мониторинг использования инструментов и компонент этического рецензирования)
Research Subject
Повышение безопасности и этической ответственности в управляемых ИИ научных исследованиях путём выявления/отказа от высокорисковых или неэтичных задач и интеграции многоуровневых защитных механизмов, оценённых с помощью бенчмарка SciSafetyBench и тестов на устойчивость к adversarial-атакам
Publication Details
Publication Date
2025-05-29
Journal
Publisher
ISSN
Cited by
1
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest