Сравнение ответов врачей и чат-бота на основе искусственного интеллекта на вопросы пациентов, размещённые в публичном форуме в социальных сетях

Comparing Physician and Artificial Intelligence Chatbot Responses to Patient Questions Posted to a Public Social Media Forum
Davey M. Smith, Mark Dredze, Chris Longhurst, Michael Hogarth, Adam Poliak, Aaron M. Goodman, John W. Ayers, Eric C. Leas, Zechariah Zhu, Jessica B. Kelley, Dennis J. Faix
2023-04-28

ChatGPTReddit r/AskDocsоценка эмпатиивопросы пациентовкачество ответов
Актуальность: Быстрое распространение виртуальной медицинской помощи привело к всплеску сообщений от пациентов и сопутствующему увеличению нагрузки и выгорания у медицинских работников. Помощники на основе искусственного интеллекта (ИИ) потенциально могут помогать в подготовке ответов на вопросы пациентов, формируя черновые ответы для проверки клиницистами. Цель: Оценить способность помощника-чатбота на базе ИИ (ChatGPT), выпущенного в ноябре 2022 года, предоставлять качественные и сопереживающие ответы на вопросы пациентов. Дизайн, место проведения и участники: В этом поперечном исследовании использована публичная анонимная база вопросов с публичного форума в социальных сетях (Reddit, r/AskDocs); случайным образом было отобрано 195 обращений за октябрь 2022 года, в которых верифицированный врач ответил на публичный вопрос. Ответы чат-бота были сгенерированы путем ввода оригинального вопроса в новую сессию (без предыдущих вопросов в сессии) 22 и 23 декабря 2022 года. Оригинальный вопрос вместе с анонимизированными и случайно перемешанными ответами врачей и чат-бота оценивали в трипликате лицензированные медицинские специалисты. Оценщики выбирали «какой ответ лучше» и оценивали как «качество предоставленной информации» (очень плохо, плохо, приемлемо, хорошо или очень хорошо), так и «эмпатию или манеру общения у постели больного» (неэмпатично, слабо эмпатично, умеренно эмпатично, эмпатично и очень эмпатично). Средние исходы ранжировали по шкале от 1 до 5 и сравнивали между чат-ботом и врачами. Результаты: Из 195 вопросов и ответов оценщики предпочли ответы чат-бота ответам врачей в 78,6% (95% ДИ, 75,0%–81,8%) из 585 оценок. Средняя (IQR) длина ответов врачей была значительно короче, чем у чат-бота (52 [17–62] слова против 211 [168–245] слов; t = 25,4; P < .001). Ответы чат-бота были оценены как статистически значимо более высокого качества, чем ответы врачей (t = 13,3; P < .001). Доля ответов, оценённых как «хорошо» или «очень хорошо» (≥4), была выше у чат-бота, чем у врачей (чат-бот: 78,5%, 95% ДИ, 72,3%–84,1%; врачи: 22,1%, 95% ДИ, 16,4%–28,2%), что соответствует 3,6-кратному превышению распространённости качественных ответов у чат-бота. Ответы чат-бота также оценивали как значительно более эмпатичные, чем ответы врачей (t = 18,9; P < .001). Доля ответов, оценённых как эмпатичные или очень эмпатичные (≥4), была выше у чат-бота, чем у врачей (чат-бот: 45,1%, 95% ДИ, 38,5%–51,8%; врачи: 4,6%, 95% ДИ, 2,1%–7,7%), что соответствует 9,8-кратному превышению распространённости эмпатичных ответов у чат-бота. Выводы: В этом поперечном исследовании чат-бот сгенерировал качественные и эмпатичные ответы на вопросы пациентов, размещённые в онлайн‑форуме. Требуется дальнейшее изучение этой технологии в клинических условиях, например, использование чат-ботов для составления черновых ответов, которые врачи затем могли бы редактировать. Рандомизированные исследования могут дополнительно оценить, может ли использование ИИ‑ассистентов улучшить ответы, снизить профессиональное выгорание врачей и улучшить результаты лечения пациентов.
1
Авторы делают вывод, что ответы, сгенерированные чатботом, можно использовать для подготовки ответов с последующим редактированием врачом, и предлагают рандомизированные испытания для оценки влияния на ответы, выгорание врачей и исходы пациентов.
2
Ответы ChatGPT получили значительно более высокую оценку качества, чем ответы врачей (t = 13,3; P < 0,001): 78,5% оценены как хорошие или очень хорошие против 22,1% у врачей.
3
Ответы ChatGPT были значительно более эмпатичными, чем ответы врачей (t = 18,9; P < 0,001): 45,1% оценены как эмпатичные или очень эмпатичные против 4,6% у врачей.
4
Ответы чатбота были значительно длиннее, чем ответы врачей (медиана 211 против 52 слов; t = 25,4; P < 0,001).
5
Оценщики предпочли ответы ChatGPT ответам врачей в 78,6% из 585 оценок (95% ДИ, 75,0%-81,8%).

Ответы на вопросы пациентов, размещённые в публичном форуме в социальной сети (Reddit r/AskDocs), сгенерированные верифицированными врачами и ИИ-чатботом (ChatGPT)

Сравнительное качество и эмпатия ответов врачей и ИИ-чатбота, включая предпочтения оценивающих, рейтинги качества информации, рейтинги эмпатии и длину ответов

Publication Details
Publication Date
2023-04-28
Journal
Publisher
ISSN
Cited by
2579
Access Type
Author Information
Authors
Davey M. Smith
Mark Dredze
Chris Longhurst
Michael Hogarth
Adam Poliak
Aaron M. Goodman
John W. Ayers
Eric C. Leas
Zechariah Zhu
Jessica B. Kelley
Dennis J. Faix
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%