Риски «AI-учёных»: приоритет защиты над автономией

Risks of AI scientists: prioritizing safeguarding over autonomy
Arman Cohan, Zhiyong Lu, Qiao Jin, Mark Gerstein, Zhuosheng Zhang, Meng Qu, Xiangru Tang, Wangchunshu Zhou, Tongxin Yuan, Kunlun Zhu, Yichi Zhang, Yilun Zhao, J. Tang, Dov Greenbaum
2025-09-18

ИИ-ученыесогласование агентовчеловеческое регулированиемодели больших языковобеспечение безопасности против автономии
AI-учёные на основе больших языковых моделей продемонстрировали значительный потенциал для автономного проведения экспериментов и содействия научным открытиям в разных дисциплинах. Несмотря на многообещающие возможности, эти агенты также вносят новые уязвимости, которые требуют тщательного рассмотрения с точки зрения безопасности. Однако всесторонних исследований этих уязвимостей пока немного. В данной перспективной статье анализируются уязвимости AI-учёных, освещаются потенциальные риски, связанные с их неправильным использованием, и подчёркивается необходимость мер безопасности. Мы начинаем с обзора потенциальных рисков, присущих AI-учёным, с учётом намерений пользователей, конкретной научной области и возможного влияния на внешнюю среду. Затем исследуем коренные причины этих уязвимостей и даём скопинговый обзор имеющихся работ. На основе нашего анализа мы предлагаем триадную рамочную модель, включающую человеческое регулирование, выравнивание агентов и понимание обратной связи с окружением (регулирование агента) для снижения выявленных рисков. Кроме того, мы подчёркиваем ограничения и проблемы, связанные с защитой AI-учёных, и выступаем за разработку улучшенных моделей, надёжных бенчмарков и всестороннего регулирования.
1
Предложена триадная рамка смягчения рисков: человеческое регулирование, выравнивание агентов и понимание обратной связи с окружением (регулирование агентов).
2
ИИ-ученые на базе больших языковых моделей способны автономно проводить эксперименты и способствовать научным открытиям в разных дисциплинах.
3
Риски зависят от намерений пользователя, научной области и возможного воздействия на внешнюю среду.
4
Существуют значительные ограничения и проблемы в обеспечении безопасности ИИ-ученых, требующие улучшенных моделей, надежных бенчмарков и всестороннего регулирования.
5
Эти ИИ-ученые вводят новые уязвимости и потенциал для злоупотреблений, требующие тщательного внимания к безопасности.
6
Проанализированы базовые причины уязвимостей, при этом существующая литература по этим уязвимостям ограничена.

ИИ-учёные на базе больших языковых моделей

Уязвимости и риски, связанные с автономными ИИ-учёными — включая возможное злоупотребление, их причины и меры смягчения через человеческое регулирование, выравнивание агентов и учёт обратной связи с окружением (приоритет защиты над автономностью)

Publication Details
Publication Date
2025-09-18
Journal
Publisher
ISSN
Cited by
32
Access Type
Author Information
Authors
Arman Cohan
Zhiyong Lu
Qiao Jin
Mark Gerstein
Zhuosheng Zhang
Meng Qu
Xiangru Tang
Wangchunshu Zhou
Tongxin Yuan
Kunlun Zhu
Yichi Zhang
Yilun Zhao
J. Tang
Dov Greenbaum
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%