Сравнение научных аннотаций, сгенерированных ChatGPT, с оригинальными аннотациями с использованием детектора AI-выхода, детектора плагиата и слепых рецензентов

Comparing scientific abstracts generated by ChatGPT to original abstracts using an artificial intelligence output detector, plagiarism detector, and blinded human reviewers
Alexander T. Pearson, Yuan Luo, Emma Dyer, Nikolay S. Markov, Catherine A. Gao, Frederick M. Howard, Siddhi Ramesh
2022-12-27

ChatGPTдетектор AI-выходаслепые рецензентыдетектор плагиатанаучные аннотации
Введение: Модели крупномасштабного языка, такие как ChatGPT, способны генерировать все более правдоподобные тексты, при этом остаются неизвестными вопросы точности и добросовестности их использования в научном письме. Методы: Мы собрали десять научных аннотаций из пяти медицинских журналов с высоким импакт-фактором (n = 50) и попросили ChatGPT сгенерировать аннотации на основе их заголовков и названий журналов. Мы оценивали аннотации с помощью детектора AI-выхода, детектора плагиата и просили слепых рецензентов определить, являются ли аннотации оригинальными или сгенерированными. Результаты: Все аннотации, сгенерированные ChatGPT, были ясно написаны, но только 8% правильно соблюдали требования форматирования конкретного журнала. Большинство сгенерированных аннотаций были обнаружены детектором AI-выхода: медианные оценки (чем выше, тем более вероятно генерация) составили 99.98% [межквартильный размах 12.73, 99.98] по сравнению с очень низкой вероятностью AI-генерации в оригинальных аннотациях — 0.02% [0.02, 0.09]. Площадь под ROC-кривой (AUROC) детектора AI-выхода составила 0.94. Сгенерированные аннотации получили очень высокие оценки оригинальности по детектору плагиата (100% [100, 100] оригинальности). Размеры когорт пациентов в сгенерированных аннотациях были сопоставимы с оригинальными, хотя точные числа были вымышленными. При предоставлении смеси оригинальных и сгенерированных аннотаций слепые рецензенты правильно определили 68% сгенерированных аннотаций как созданные ChatGPT, но ошибочно сочли 14% оригинальных аннотаций сгенерированными. Рецензенты отметили, что различить их было неожиданно трудно, хотя сгенерированные аннотации казались более расплывчатыми и имели формульный стиль изложения. Заключение: ChatGPT пишет правдоподобные научные аннотации, но с полностью сгенерированными данными. Они оригинальны и не содержат выявленного плагиата, однако часто выявляются с помощью детектора AI-выхода и внимательных рецензентов. Оценка аннотаций для журналов и медицинских конференций должна адаптировать политику и практику для поддержания строгих научных стандартов; мы предлагаем включение детекторов AI-выхода в редакционный процесс и четкое раскрытие факта использования этих технологий. Границы этического и приемлемого использования крупных языковых моделей для помощи в научном письме остаются неустановленными.
1
Детектор AI присвоил сгенерированным аннотациям высокие оценки вероятности: медиана 99.98% (IQR 12.73, 99.98) против 0.02% (IQR 0.02, 0.09) для оригиналов.
2
Слепые рецензенты правильно определили 68% сгенерированных аннотаций, но ошибочно пометили 14% оригиналов как сгенерированные; рецензенты отмечали более неопределённый и шаблонный стиль сгенерированных аннотаций.
3
ChatGPT сгенерировал понятные научные аннотации для 50 статей, но только 8% соответствовали требованиям форматирования конкретных журналов.
4
Сгенерированные аннотации содержали вымышленные точные числовые данные (например, размеры когорт пациентов), но по величине совпадали с оригиналами.
5
Детектор плагиата показал высокую оригинальность сгенерированных аннотаций: 100% [100, 100].
6
Рекомендация: включить детекторы AI в редакционные процессы и требовать ясного раскрытия факта использования больших языковых моделей при подготовке научных текстов.
7
Детектор AI достиг AUROC 0.94 при различении сгенерированных и оригинальных аннотаций.

Научные рефераты/аннотации (оригинальные и сгенерированные ChatGPT)

Сравнительная оценка и обнаружение рефератов, сгенерированных ChatGPT, и оригинальных рефератов с использованием детектора AI-выхода, детектора плагиата и слепых рецензентов; включая соответствие форматированию, показатели оригинальности, наличие сгенерированных данных и точность выявления рецензентами

Publication Details
Publication Date
2022-12-27
Journal
Publisher
ISSN
Cited by
419
Access Type
Author Information
Authors
Alexander T. Pearson
Yuan Luo
Emma Dyer
Nikolay S. Markov
Catherine A. Gao
Frederick M. Howard
Siddhi Ramesh
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%