Сравнение научных аннотаций, сгенерированных ChatGPT, с оригинальными аннотациями с использованием детектора AI-выхода, детектора плагиата и слепых рецензентов
Comparing scientific abstracts generated by ChatGPT to original abstracts using an artificial intelligence output detector, plagiarism detector, and blinded human reviewers
2022-12-27
SCID: 54.1/sufwfm93
Discuss with AI
ChatGPTдетектор AI-выходаслепые рецензентыдетектор плагиатанаучные аннотации
Figures from the paper
Abstract (AI)
Введение: Модели крупномасштабного языка, такие как ChatGPT, способны генерировать все более правдоподобные тексты, при этом остаются неизвестными вопросы точности и добросовестности их использования в научном письме. Методы: Мы собрали десять научных аннотаций из пяти медицинских журналов с высоким импакт-фактором (n = 50) и попросили ChatGPT сгенерировать аннотации на основе их заголовков и названий журналов. Мы оценивали аннотации с помощью детектора AI-выхода, детектора плагиата и просили слепых рецензентов определить, являются ли аннотации оригинальными или сгенерированными. Результаты: Все аннотации, сгенерированные ChatGPT, были ясно написаны, но только 8% правильно соблюдали требования форматирования конкретного журнала. Большинство сгенерированных аннотаций были обнаружены детектором AI-выхода: медианные оценки (чем выше, тем более вероятно генерация) составили 99.98% [межквартильный размах 12.73, 99.98] по сравнению с очень низкой вероятностью AI-генерации в оригинальных аннотациях — 0.02% [0.02, 0.09]. Площадь под ROC-кривой (AUROC) детектора AI-выхода составила 0.94. Сгенерированные аннотации получили очень высокие оценки оригинальности по детектору плагиата (100% [100, 100] оригинальности). Размеры когорт пациентов в сгенерированных аннотациях были сопоставимы с оригинальными, хотя точные числа были вымышленными. При предоставлении смеси оригинальных и сгенерированных аннотаций слепые рецензенты правильно определили 68% сгенерированных аннотаций как созданные ChatGPT, но ошибочно сочли 14% оригинальных аннотаций сгенерированными. Рецензенты отметили, что различить их было неожиданно трудно, хотя сгенерированные аннотации казались более расплывчатыми и имели формульный стиль изложения. Заключение: ChatGPT пишет правдоподобные научные аннотации, но с полностью сгенерированными данными. Они оригинальны и не содержат выявленного плагиата, однако часто выявляются с помощью детектора AI-выхода и внимательных рецензентов. Оценка аннотаций для журналов и медицинских конференций должна адаптировать политику и практику для поддержания строгих научных стандартов; мы предлагаем включение детекторов AI-выхода в редакционный процесс и четкое раскрытие факта использования этих технологий. Границы этического и приемлемого использования крупных языковых моделей для помощи в научном письме остаются неустановленными.
Key Findings
1
Детектор AI присвоил сгенерированным аннотациям высокие оценки вероятности: медиана 99.98% (IQR 12.73, 99.98) против 0.02% (IQR 0.02, 0.09) для оригиналов.
2
Слепые рецензенты правильно определили 68% сгенерированных аннотаций, но ошибочно пометили 14% оригиналов как сгенерированные; рецензенты отмечали более неопределённый и шаблонный стиль сгенерированных аннотаций.
3
ChatGPT сгенерировал понятные научные аннотации для 50 статей, но только 8% соответствовали требованиям форматирования конкретных журналов.
4
Сгенерированные аннотации содержали вымышленные точные числовые данные (например, размеры когорт пациентов), но по величине совпадали с оригиналами.
5
Детектор плагиата показал высокую оригинальность сгенерированных аннотаций: 100% [100, 100].
6
Рекомендация: включить детекторы AI в редакционные процессы и требовать ясного раскрытия факта использования больших языковых моделей при подготовке научных текстов.
7
Детектор AI достиг AUROC 0.94 при различении сгенерированных и оригинальных аннотаций.
Research Object
Научные рефераты/аннотации (оригинальные и сгенерированные ChatGPT)
Research Subject
Сравнительная оценка и обнаружение рефератов, сгенерированных ChatGPT, и оригинальных рефератов с использованием детектора AI-выхода, детектора плагиата и слепых рецензентов; включая соответствие форматированию, показатели оригинальности, наличие сгенерированных данных и точность выявления рецензентами
Publication Details
Publication Date
2022-12-27
Journal
Publisher
ISSN
Cited by
419
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Работы, цитирующие эту статью6
Дискуссионная статья: «Ну и что, если это написал ChatGPT?» Междисциплинарные взгляды на возможности, проблемы и последствия применения генеративного разговорного искусственного интеллекта в исследованиях, практике и политике2023
Полезность ChatGPT в образовании, исследованиях и практике здравоохранения: систематический обзор перспективных возможностей и обоснованных опасений2023
ChatGPT: генератор бессмыслицы или конец традиционного оценивания в высшем образовании?2023
Влияние чрезмерной зависимости от диалоговых систем искусственного интеллекта на когнитивные способности студентов: систематический обзор2024
Обзор безопасности и конфиденциальности больших языковых моделей (LLM): Хорошее, Плохое и Уродливое2024
Война чат-ботов: Bard, Bing Chat, ChatGPT, Ernie и другие. Новая золотая лихорадка ИИ и её влияние на высшее образование2023