Объяснимость больших языковых моделей: обзор

Explainability for Large Language Models: A Survey
Shuaiqiang Wang, Ninghao Liu, Mengnan Du, Fan Yang, Hengyi Cai, Haiyan Zhao, Hanjie Chen, Huiqi Deng, Dawei Yin
2024-01-02

языковые модели на основе Transformerметоды объяснимостиметрики оценки объясненийбольшие языковые моделилокальные и глобальные объяснения
Большие языковые модели (LLM) продемонстрировали впечатляющие возможности в области обработки естественного языка. Однако механизмы их функционирования по-прежнему остаются недостаточно изученными, а недостаток прозрачности создает нежелательные риски для последующих приложений. Поэтому понимание и объяснение работы этих моделей имеют ключевое значение для выяснения особенностей их поведения, ограничений и социального воздействия. В этой статье мы предлагаем таксономию методов обеспечения объяснимости и представляем структурированный обзор методов объяснения работы языковых моделей на основе архитектуры Transformer. Мы классифицируем методы в соответствии с парадигмами обучения больших языковых моделей: традиционной парадигмой на основе дообучения и парадигмой на основе промптинга. Для каждой парадигмы мы обобщаем цели и основные подходы к формированию локальных объяснений отдельных предсказаний и глобальных объяснений совокупных знаний модели. Кроме того, мы рассматриваем метрики оценки сформированных объяснений и обсуждаем, как объяснения могут использоваться для отладки моделей и повышения их производительности. Наконец, мы анализируем ключевые проблемы и новые возможности методов объяснения в эпоху больших языковых моделей в сравнении с традиционными моделями глубокого обучения.
1
Для каждой парадигмы различаются локальные объяснения отдельных предсказаний и глобальные объяснения общих знаний модели.
2
Выделены ключевые проблемы и перспективные направления объяснения LLM по сравнению с традиционными моделями глубокого обучения.
3
Методы объяснения организованы в соответствии с двумя парадигмами обучения LLM: традиционной тонкой настройкой и промптингом.
4
В обзоре представлена таксономия методов объяснимости для больших языковых моделей на основе архитектуры Transformer.
5
В обзоре рассматриваются метрики оценки сгенерированных объяснений и способы использования объяснений для отладки моделей и повышения их производительности.

большие языковые модели (LLM), в частности языковые модели на основе Transformer

объяснимость их внутренних механизмов, поведения, ограничений, социальных последствий, предсказаний и усвоенных знаний

Publication Details
Publication Date
2024-01-02
Journal
Publisher
ISSN
Cited by
624
Access Type
Author Information
Authors
Shuaiqiang Wang
Ninghao Liu
Mengnan Du
Fan Yang
Hengyi Cai
Haiyan Zhao
Hanjie Chen
Huiqi Deng
Dawei Yin
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat →
Make a presentation
100%