"Что важно в текстовом документе?": Интерпретируемый подход машинного обучения
"What is relevant in a text document?": An interpretable machine learning approach
2017-08-11
SCID: 54.1/fv7eraga
Discuss with AI
SVM на основе мешка словсверточная нейронная сетьраспространение релевантности по слоямвекторные представления документовоценки релевантности слов
Figures from the paper
Abstract (AI)
Текстовые документы можно описать рядом абстрактных понятий, таких как семантическая категория, стиль письма или сентимент. Модели машинного обучения (ML) обучены автоматически сопоставлять документы этим абстрактным понятиям, что позволяет аннотировать очень большие коллекции текстов, которых человек не обработал бы за всю жизнь. Помимо высокой точности предсказания категории текста, желательна также интерпретация того, как и почему происходит категоризация. В этой статье мы демонстрируем, что такое понимание можно получить, прослеживая решение классификатора до отдельных слов с помощью послойной пропагации релевантности (layer-wise relevance propagation, LRP) — недавно разработанной техники для объяснения предсказаний сложных нелинейных классификаторов. Мы обучаем две слово-ориентированные модели ML — сверточную нейронную сеть (CNN) и SVM-классификатор на основе мешка слов (bag-of-words) — на задаче тематической категоризации и адаптируем метод LRP для разложения предсказаний этих моделей по словам. Полученные оценки показывают, насколько отдельные слова вносят вклад в общее решение классификации, что позволяет извлекать релевантную информацию из текстов без явного шага семантического извлечения. Далее мы используем покомпонентные оценки релевантности слов для генерации новых векторных представлений документов, которые захватывают семантическую информацию. На основе этих векторных представлений документов мы вводим меру объяснительной силы модели и показываем, что хотя SVM и CNN демонстрируют схожую точность классификации, CNN обладает более высоким уровнем объяснимости, что делает её более понятной для человека и потенциально полезной для других приложений.
Key Findings
1
Хотя CNN и SVM демонстрируют сопоставимую точность классификации, CNN обладает более высокой объяснимостью по введённой мере explanatory power, основанной на LRP-выведённых векторах документов.
2
LRP был адаптирован для разложения предсказаний как сверточной нейронной сети (CNN), так и SVM на основе мешка слов в задаче тематической категоризации.
3
Пошаговая пропагация релевантности (LRP) может проследить решения классификации сложных нелинейных текстовых классификаторов до отдельных слов, давая оценки релевантности на уровне слов.
4
Оценки релевантности слов позволяют извлекать релевантную информацию из текстов без явного шага семантического извлечения и могут быть использованы для формирования новых векторных представлений документов, улавливающих семантическую информацию.
Research Object
Модели текстовой классификации на основе слов (CNN и SVM с мешком слов), применённые к тематической категоризации текстовых документов
Research Subject
Разложение предсказаний моделей на уровне слов с помощью layer-wise relevance propagation (LRP) для выявления релевантности отдельных слов, построения векторных представлений документов, сохраняющих семантику, и оценки объяснимости моделей
Publication Details
Publication Date
2017-08-11
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest