Предвзятость в больших языковых моделях: происхождение, оценка и методы снижения

Bias in Large Language Models: Origin, Evaluation, and Mitigation
Yufei Guo, Muzhe Guo, Juntao Su, Zhou Yang, Mengqiu Zhu, Hongfei Li, Mengyang Qiu, Shuo Shuo Liu
2026-04-24

предвзятость LLMоценка предвзятостисмягчение предвзятостисправедливый искусственный интеллектбольшие языковые модели
Большие языковые модели (LLM) произвели революцию в области обработки естественного языка, однако их подверженность предвзятости создает значительные проблемы. В этом всестороннем обзоре рассматривается проблема предвзятости в LLM — от ее происхождения до современных стратегий снижения. Предвзятость классифицируется как внутренняя и внешняя, а также анализируются ее проявления в различных задачах обработки естественного языка (NLP). В обзоре критически оценивается широкий спектр методов оценки предвзятости, включая подходы на уровне данных, модели и выходных данных, что предоставляет исследователям надежный инструментарий для выявления предвзятости. Кроме того, рассматриваются стратегии снижения предвзятости, классифицированные как домодельные, внутримодельные и постмодельные методы, с акцентом на их эффективность и ограничения. Обсуждаются этические и правовые последствия использования предвзятых LLM, включая потенциальный вред в реальных приложениях, таких как здравоохранение и уголовное правосудие. Обобщая современные знания о предвзятости в LLM, данный обзор вносит вклад в продолжающиеся усилия по разработке справедливых и ответственных систем искусственного интеллекта (AI). Наша работа служит всесторонним ресурсом для исследователей и практиков, стремящихся понять, оценить и снизить предвзятость в LLM, способствуя разработке более справедливых технологий искусственного интеллекта.
1
Предвзятые LLM могут приводить к существенным этическим и правовым последствиям в реальных сферах применения, включая здравоохранение и уголовное правосудие.
2
Методы обнаружения предвзятости оцениваются на уровне данных, модели и выходных результатов, формируя структурированный инструментарий для анализа предвзятости LLM.
3
Стратегии смягчения предвзятости разделены на домодельные, внутримодельные и постмодельные методы, при этом критически рассматриваются их эффективность и ограничения.
4
Обзор классифицирует предвзятость больших языковых моделей на внутреннюю и внешнюю и рассматривает её проявления в различных задачах обработки естественного языка.
5
Обобщение современных знаний направлено на поддержку разработки более справедливых и ответственных систем искусственного интеллекта.

предвзятость в больших языковых моделях (LLM)

происхождение, проявления, оценка и снижение предвзятости в LLM, включая этические и правовые последствия

Publication Details
Publication Date
2026-04-24
Journal
Publisher
ISSN
Cited by
26
Access Type
Author Information
Authors
Yufei Guo
Muzhe Guo
Juntao Su
Zhou Yang
Mengqiu Zhu
Hongfei Li
Mengyang Qiu
Shuo Shuo Liu
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%