Проверка ChatGPT методом red teaming в медицине для получения практических сведений о поведении модели
Red teaming ChatGPT in medicine to yield real-world insights on model behavior
2025-03-07
SCID: 54.1/dzzkv7ne
Discuss with AI
клинические случаигаллюцинации и предвзятостьбольшие языковые моделибезопасность моделейредтиминг
Figures from the paper
Abstract (AI)
Red teaming — практика проведения враждебного тестирования для выявления неожиданных или нежелательных форм поведения модели — имеет решающее значение для повышения справедливости и точности больших языковых моделей, однако независимое от разработчиков моделей red teaming в здравоохранении проводится редко. Мы сформировали команды клиницистов, студентов медицинских и инженерных специальностей, а также технических специалистов (всего 80 участников), чтобы подвергнуть модели стресс-тестированию на реальных клинических случаях и классифицировать некорректные ответы по следующим направлениям: безопасность, конфиденциальность, галлюцинации/точность и предвзятость. Шесть рецензентов с медицинской подготовкой повторно проанализировали пары «запрос–ответ» и добавили качественные аннотации. Из 376 уникальных запросов (1 504 ответа) 20,1% были признаны некорректными (GPT-3.5: 25,8%; GPT-4.0: 16%; GPT-4.0 с доступом к Интернету: 17,8%). Затем мы продемонстрировали практическую ценность нашего эталонного набора, протестировав GPT-4o — модель, выпущенную после проведения нашего мероприятия; доля некорректных ответов составила 20,4%. Среди ответов, признанных корректными для GPT-3.5, 21,5% оказались некорректными в обновлённых моделях. Мы представляем выводы о разработке запросов для red teaming, а также наш эталонный набор для итеративной оценки моделей.
Key Findings
1
В независимом от разработчиков красном тестировании участвовали 80 врачей, студентов и технических специалистов, оценивавших медицинские модели на реальных клинических случаях.
2
Из 376 уникальных запросов и 1504 ответов 20,1% были признаны неуместными по критериям безопасности, конфиденциальности, галлюцинаций/точности и предвзятости.
3
Доля неуместных ответов различалась между моделями: 25,8% у GPT-3.5, 16% у GPT-4.0 и 17,8% у GPT-4.0 с доступом к Интернету.
4
Обновления моделей не всегда сохраняли безопасное поведение: 21,5% ответов, приемлемых у GPT-3.5, стали неуместными в обновленных моделях.
5
Предложенный бенчмарк выявил 20,4% неуместных ответов у GPT-4o, выпущенной после проведения исходного мероприятия.
Research Object
ChatGPT и связанные с ним модели GPT, применяемые к реальным клиническим случаям
Research Subject
Поведение моделей, включая безопасность, конфиденциальность, галлюцинации/точность, предвзятость и изменения частоты неуместных ответов при adversarial-тестировании на клинических случаях
Publication Details
Publication Date
2025-03-07
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest