Проверка ChatGPT методом red teaming в медицине для получения практических сведений о поведении модели

Red teaming ChatGPT in medicine to yield real-world insights on model behavior
Yanan Ding, Archer Y. Yang, Jonathan H. Chen, Lü Tian, Matthew Schwede, Nigam H. Shah, Jesutofunmi A. Omiye, Haiwen Gui, Shawheen J. Rezaei, Roxana Daneshjou, Scott L. Fleming, Jason Fries, Balasubramanian Narasimhan, Juan M. Banda, Crystal Chang, Hodan Farah, Charbel Bou-Khalil, Ye-Jean Park, Akshay Swaminathan, Akaash Kolluri, Akash Chaurasia, Alejandro Lozano, Alice Heiman, Allison Sihan Jia, Amit Kaushal, Angela Y. Jia, Angelica Iacovelli, Arghavan Salles, Arpita Singhal, Benjamin Belai, Benjamin H. Jacobson, Binglan Li, Celeste H. Poe, Chandan Sanghera, Chenming Zheng, Conor Messer, Damien Varid Kettud, Deven Pandya, Dhamanpreet Kaur, Diana Hla, Diba Dindoust, Dominik Moehrle, Ross Duncan, Ellaine Chou, Eric Lin, Fateme Nateghi Haredasht, Cheng Ge, Irena Gao, Jacob Chang, Jake Silberg, Jiapeng Xu, J. Weston Jamison, John Tamaresis, Joshua Lazaro, Julie Lee, Karen Ebert Matthys, Kirsten R. Steffner, Luca Pegolotti, Malathi Srinivasan, Maniragav Manimaran, Minghe Zhang, Minh Hoai Nguyen, Mohsen Fathzadeh, Qian Zhao, Rika Bajra, Rohit Khurana, Ruhana Azam, R. W. Bartlett, Sang Truong, S. Varadha Raj, Solveig Behr, Sonia Onyeka, Sri Muppidi, Tarek Bandali, Tiffany Eulalio, Wenyuan Chen, Xuanyu Zhou, Ying Cui, Yuqi Tan, Yutong Liu
2025-03-07

клинические случаигаллюцинации и предвзятостьбольшие языковые моделибезопасность моделейредтиминг
Red teaming — практика проведения враждебного тестирования для выявления неожиданных или нежелательных форм поведения модели — имеет решающее значение для повышения справедливости и точности больших языковых моделей, однако независимое от разработчиков моделей red teaming в здравоохранении проводится редко. Мы сформировали команды клиницистов, студентов медицинских и инженерных специальностей, а также технических специалистов (всего 80 участников), чтобы подвергнуть модели стресс-тестированию на реальных клинических случаях и классифицировать некорректные ответы по следующим направлениям: безопасность, конфиденциальность, галлюцинации/точность и предвзятость. Шесть рецензентов с медицинской подготовкой повторно проанализировали пары «запрос–ответ» и добавили качественные аннотации. Из 376 уникальных запросов (1 504 ответа) 20,1% были признаны некорректными (GPT-3.5: 25,8%; GPT-4.0: 16%; GPT-4.0 с доступом к Интернету: 17,8%). Затем мы продемонстрировали практическую ценность нашего эталонного набора, протестировав GPT-4o — модель, выпущенную после проведения нашего мероприятия; доля некорректных ответов составила 20,4%. Среди ответов, признанных корректными для GPT-3.5, 21,5% оказались некорректными в обновлённых моделях. Мы представляем выводы о разработке запросов для red teaming, а также наш эталонный набор для итеративной оценки моделей.
1
В независимом от разработчиков красном тестировании участвовали 80 врачей, студентов и технических специалистов, оценивавших медицинские модели на реальных клинических случаях.
2
Из 376 уникальных запросов и 1504 ответов 20,1% были признаны неуместными по критериям безопасности, конфиденциальности, галлюцинаций/точности и предвзятости.
3
Доля неуместных ответов различалась между моделями: 25,8% у GPT-3.5, 16% у GPT-4.0 и 17,8% у GPT-4.0 с доступом к Интернету.
4
Обновления моделей не всегда сохраняли безопасное поведение: 21,5% ответов, приемлемых у GPT-3.5, стали неуместными в обновленных моделях.
5
Предложенный бенчмарк выявил 20,4% неуместных ответов у GPT-4o, выпущенной после проведения исходного мероприятия.

ChatGPT и связанные с ним модели GPT, применяемые к реальным клиническим случаям

Поведение моделей, включая безопасность, конфиденциальность, галлюцинации/точность, предвзятость и изменения частоты неуместных ответов при adversarial-тестировании на клинических случаях

Publication Details
Publication Date
2025-03-07
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Yanan Ding
Archer Y. Yang
Jonathan H. Chen
Lü Tian
Matthew Schwede
Nigam H. Shah
Jesutofunmi A. Omiye
Haiwen Gui
Shawheen J. Rezaei
Roxana Daneshjou
Scott L. Fleming
Jason Fries
Balasubramanian Narasimhan
Juan M. Banda
Crystal Chang
Hodan Farah
Charbel Bou-Khalil
Ye-Jean Park
Akshay Swaminathan
Akaash Kolluri
Akash Chaurasia
Alejandro Lozano
Alice Heiman
Allison Sihan Jia
Amit Kaushal
Angela Y. Jia
Angelica Iacovelli
Arghavan Salles
Arpita Singhal
Benjamin Belai
Benjamin H. Jacobson
Binglan Li
Celeste H. Poe
Chandan Sanghera
Chenming Zheng
Conor Messer
Damien Varid Kettud
Deven Pandya
Dhamanpreet Kaur
Diana Hla
Diba Dindoust
Dominik Moehrle
Ross Duncan
Ellaine Chou
Eric Lin
Fateme Nateghi Haredasht
Cheng Ge
Irena Gao
Jacob Chang
Jake Silberg
Jiapeng Xu
J. Weston Jamison
John Tamaresis
Joshua Lazaro
Julie Lee
Karen Ebert Matthys
Kirsten R. Steffner
Luca Pegolotti
Malathi Srinivasan
Maniragav Manimaran
Minghe Zhang
Minh Hoai Nguyen
Mohsen Fathzadeh
Qian Zhao
Rika Bajra
Rohit Khurana
Ruhana Azam
R. W. Bartlett
Sang Truong
S. Varadha Raj
Solveig Behr
Sonia Onyeka
Sri Muppidi
Tarek Bandali
Tiffany Eulalio
Wenyuan Chen
Xuanyu Zhou
Ying Cui
Yuqi Tan
Yutong Liu
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat →
Make a presentation
100%