Объяснимость больших языковых моделей: обзор
Explainability for Large Language Models: A Survey
2024-01-02
SCID: 54.1/2xh8g3ma
Discuss with AI
языковые модели на основе Transformerметоды объяснимостиметрики оценки объясненийбольшие языковые моделилокальные и глобальные объяснения
Figures from the paper
Abstract (AI)
Большие языковые модели (LLM) продемонстрировали впечатляющие возможности в области обработки естественного языка. Однако механизмы их функционирования по-прежнему остаются недостаточно изученными, а недостаток прозрачности создает нежелательные риски для последующих приложений. Поэтому понимание и объяснение работы этих моделей имеют ключевое значение для выяснения особенностей их поведения, ограничений и социального воздействия. В этой статье мы предлагаем таксономию методов обеспечения объяснимости и представляем структурированный обзор методов объяснения работы языковых моделей на основе архитектуры Transformer. Мы классифицируем методы в соответствии с парадигмами обучения больших языковых моделей: традиционной парадигмой на основе дообучения и парадигмой на основе промптинга. Для каждой парадигмы мы обобщаем цели и основные подходы к формированию локальных объяснений отдельных предсказаний и глобальных объяснений совокупных знаний модели. Кроме того, мы рассматриваем метрики оценки сформированных объяснений и обсуждаем, как объяснения могут использоваться для отладки моделей и повышения их производительности. Наконец, мы анализируем ключевые проблемы и новые возможности методов объяснения в эпоху больших языковых моделей в сравнении с традиционными моделями глубокого обучения.
Key Findings
1
Для каждой парадигмы различаются локальные объяснения отдельных предсказаний и глобальные объяснения общих знаний модели.
2
Выделены ключевые проблемы и перспективные направления объяснения LLM по сравнению с традиционными моделями глубокого обучения.
3
Методы объяснения организованы в соответствии с двумя парадигмами обучения LLM: традиционной тонкой настройкой и промптингом.
4
В обзоре представлена таксономия методов объяснимости для больших языковых моделей на основе архитектуры Transformer.
5
В обзоре рассматриваются метрики оценки сгенерированных объяснений и способы использования объяснений для отладки моделей и повышения их производительности.
Research Object
большие языковые модели (LLM), в частности языковые модели на основе Transformer
Research Subject
объяснимость их внутренних механизмов, поведения, ограничений, социальных последствий, предсказаний и усвоенных знаний
Publication Details
Publication Date
2024-01-02
Journal
Publisher
ISSN
Cited by
624
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai4
Работы, цитирующие эту статью2
Генеративный искусственный интеллект и большие языковые модели для защиты критической инфраструктуры: оценочные бенчмарки, агентный искусственный интеллект, проблемы и возможности2025
Исследовательский ландшафт агентного искусственного интеллекта и больших языковых моделей: применения, проблемы и перспективные направления2025