На пути к достоверному объяснению моделей в обработке естественного языка: обзор

Towards Faithful Model Explanation in NLP: A Survey
Chris Callison-Burch, Qing Lyu, Marianna Apidianaki
2024-01-01

контрфактическое вмешательствообъяснимостьдостоверное объяснение моделейобработка естественного языкасамообъясняемые модели
Сквозные нейросетевые модели обработки естественного языка (NLP) отличаются известной трудностью интерпретации. В последние годы это привело к многочисленным исследованиям, посвящённым объяснимости моделей. Одним из требований к объяснениям моделей является достоверность, то есть объяснение должно точно отражать процесс рассуждения, лежащий в основе предсказания модели. В этом обзоре мы рассматриваем более 110 методов объяснения моделей в обработке естественного языка с точки зрения их достоверности. Сначала мы обсуждаем определение и оценивание достоверности, а также её значение для объяснимости. Затем мы представляем последние достижения в области достоверных объяснений, объединяя существующие подходы в пять категорий: методы на основе сходства, анализ внутренних структур модели, методы на основе обратного распространения, контрфактическое вмешательство и самопоясняющие модели. Для каждой категории мы обобщаем результаты репрезентативных исследований, их сильные и слабые стороны. Наконец, мы суммируем их общие достоинства и сохраняющиеся проблемы, а также рассматриваем перспективные направления дальнейших исследований в области достоверной объяснимости в обработке естественного языка.
1
Существующие подходы к обеспечению faithfulness разделены на пять категорий: методы на основе сходства, анализ внутренних структур модели, методы на основе обратного распространения, контрфактические вмешательства и самообъясняющиеся модели.
2
В работе анализируются определения и методы оценки faithfulness, которая рассматривается как ключевое требование к надежной объяснимости NLP-моделей.
3
Обзор формулирует направления будущих исследований по созданию более faithful-методов объяснимости в NLP.
4
В обзоре рассматривается более 110 методов объяснения моделей NLP, систематизированных по критерию faithfulness — способности объяснения точно отражать ход рассуждений модели при принятии решения.
5
Для каждой категории обобщаются代表ительные исследования, их преимущества и недостатки, а также выявляются общие достоинства и нерешенные проблемы.

методы объяснения моделей в моделях обработки естественного языка (NLP)

достоверность объяснений, включая то, насколько точно они отражают процесс рассуждения модели, лежащий в основе предсказаний

Publication Details
Publication Date
2024-01-01
Journal
Publisher
ISSN
Cited by
97
Access Type
Author Information
Authors
Chris Callison-Burch
Qing Lyu
Marianna Apidianaki
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%