На пути к достоверному объяснению моделей в обработке естественного языка: обзор
Towards Faithful Model Explanation in NLP: A Survey
2024-01-01
SCID: 54.1/thc4xxwm
Discuss with AI
контрфактическое вмешательствообъяснимостьдостоверное объяснение моделейобработка естественного языкасамообъясняемые модели
Figures from the paper
Abstract (AI)
Сквозные нейросетевые модели обработки естественного языка (NLP) отличаются известной трудностью интерпретации. В последние годы это привело к многочисленным исследованиям, посвящённым объяснимости моделей. Одним из требований к объяснениям моделей является достоверность, то есть объяснение должно точно отражать процесс рассуждения, лежащий в основе предсказания модели. В этом обзоре мы рассматриваем более 110 методов объяснения моделей в обработке естественного языка с точки зрения их достоверности. Сначала мы обсуждаем определение и оценивание достоверности, а также её значение для объяснимости. Затем мы представляем последние достижения в области достоверных объяснений, объединяя существующие подходы в пять категорий: методы на основе сходства, анализ внутренних структур модели, методы на основе обратного распространения, контрфактическое вмешательство и самопоясняющие модели. Для каждой категории мы обобщаем результаты репрезентативных исследований, их сильные и слабые стороны. Наконец, мы суммируем их общие достоинства и сохраняющиеся проблемы, а также рассматриваем перспективные направления дальнейших исследований в области достоверной объяснимости в обработке естественного языка.
Key Findings
1
Существующие подходы к обеспечению faithfulness разделены на пять категорий: методы на основе сходства, анализ внутренних структур модели, методы на основе обратного распространения, контрфактические вмешательства и самообъясняющиеся модели.
2
В работе анализируются определения и методы оценки faithfulness, которая рассматривается как ключевое требование к надежной объяснимости NLP-моделей.
3
Обзор формулирует направления будущих исследований по созданию более faithful-методов объяснимости в NLP.
4
В обзоре рассматривается более 110 методов объяснения моделей NLP, систематизированных по критерию faithfulness — способности объяснения точно отражать ход рассуждений модели при принятии решения.
5
Для каждой категории обобщаются代表ительные исследования, их преимущества и недостатки, а также выявляются общие достоинства и нерешенные проблемы.
Research Object
методы объяснения моделей в моделях обработки естественного языка (NLP)
Research Subject
достоверность объяснений, включая то, насколько точно они отражают процесс рассуждения модели, лежащий в основе предсказаний
Publication Details
Publication Date
2024-01-01
Journal
Publisher
ISSN
Cited by
97
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest