Смещение обобщения при суммаризации научных исследований большими языковыми моделями

Generalization bias in large language model summarization of scientific research
Benjamin Chin‐Yee, Uwe Peters
2025-04-01

точность обобщениясмещение обобщениябольшие языковые моделичрезмерное обобщение выводовсуммирование научных текстов
Чат-боты на основе искусственного интеллекта, работающие с большими языковыми моделями (LLM), способны повышать научную грамотность широкой общественности и поддерживать научные исследования, поскольку они могут быстро суммировать сложную научную информацию в доступной форме. Однако при суммаризации научных текстов LLM могут опускать детали, ограничивающие область применимости выводов исследования, что приводит к обобщениям результатов, более широким, чем это допускает исходное исследование. Мы протестировали 10 известных LLM, включая ChatGPT-4o, ChatGPT-4.5, DeepSeek, LLaMA 3.3 70B и Claude 3.7 Sonnet, сопоставив 4900 резюме, созданных LLM, с исходными научными текстами. Даже при явном указании обеспечивать точность большинство LLM формулировали более широкие обобщения научных результатов, чем содержались в исходных текстах; у DeepSeek, ChatGPT-4o и LLaMA 3.3 70B чрезмерные обобщения встречались в 26–73% случаев. При прямом сравнении научных резюме, созданных LLM и людьми, вероятность широких обобщений в резюме LLM была почти в пять раз выше (отношение шансов = 4.85, 95% ДИ [3.06, 7.70], p < 0.001). Примечательно, что более новые модели, как правило, демонстрировали меньшую точность обобщения по сравнению с более ранними моделями. Наши результаты указывают на выраженное смещение многих широко используемых LLM в сторону чрезмерного обобщения научных выводов, что создает значительный риск масштабного неправильного истолкования результатов исследований. Мы обозначаем потенциальные стратегии снижения этого риска, включая понижение настроек температуры LLM и бенчмаркинг LLM по точности обобщения.
1
DeepSeek, ChatGPT-4o и LLaMA 3.3 70B чрезмерно обобщали научные результаты в 26–73% рассмотренных случаев.
2
Научные резюме, созданные LLM, почти в пять раз чаще содержали широкие обобщения, чем резюме, написанные людьми (отношение шансов 4,85; 95% ДИ 3,06–7,70; p < 0,001).
3
Большинство из 10 оценённых больших языковых моделей обобщали выводы научных исследований шире, чем это было обосновано исходными текстами, даже при явном запросе на точность.
4
Более новые языковые модели, как правило, хуже более ранних сохраняли корректные границы обобщения научных результатов.
5
Выявленное смещение к чрезмерному обобщению создаёт риск массового неправильного понимания исследований; среди мер снижения риска предложены уменьшение температуры модели и бенчмаркинг точности обобщений.

резюме научных текстов, созданные большими языковыми моделями

смещение в сторону чрезмерного обобщения и точность обобщения научных выводов в резюме, созданных большими языковыми моделями

Publication Details
Publication Date
2025-04-01
Journal
Publisher
ISSN
Cited by
115
Access Type
Author Information
Authors
Benjamin Chin‐Yee
Uwe Peters
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%