REALM: предварительное обучение языковой модели с дополнением за счет извлечения информации

REALM: Retrieval-Augmented Language Model Pre-Training
Ming‐Wei Chang, Kelvin Guu, Zora Tung, Kenton Lee, Panupong Pasupat
2020-02-10

REALMлатентный извлекатель знаниймаскированное языковое моделированиевопросно-ответная система в открытом доменепредобучение языковой модели с дополнением извлечением
Показано, что предварительное обучение языковой модели позволяет усвоить удивительно большой объем знаний о мире, необходимых для таких задач обработки естественного языка (NLP), как ответы на вопросы. Однако эти знания хранятся неявно в параметрах нейронной сети, что требует создания все более крупных сетей для охвата большего числа фактов. Чтобы представить знания более модульным и интерпретируемым способом, мы дополняем предварительное обучение языковой модели скрытым модулем извлечения знаний, который позволяет модели извлекать документы из большого корпуса, такого как Wikipedia, и учитывать их содержимое при обработке; корпус используется на этапах предварительного обучения, дообучения и вывода. Впервые мы показываем, как предварительно обучать такой модуль извлечения знаний без учителя, используя моделирование языка с маскированием в качестве обучающего сигнала и выполняя обратное распространение ошибки через этап извлечения, на котором рассматриваются миллионы документов. Мы демонстрируем эффективность предварительного обучения языковой модели с дополнением за счет извлечения информации (Retrieval-Augmented Language Model pre-training, REALM), выполняя дообучение на сложной задаче ответов на вопросы по открытой предметной области (Open-domain Question Answering, Open-QA). Мы сравниваем REALM с современными моделями, использующими как явное, так и неявное хранение знаний, на трех популярных тестах Open-QA и обнаруживаем, что превосходим все предыдущие методы с существенным отрывом (на 4–16 процентных пунктов по абсолютной точности), одновременно обеспечивая такие качественные преимущества, как интерпретируемость и модульность.
1
После дообучения для открытых вопросов REALM превосходит предыдущие модели с явным и неявным хранением знаний на 4–16 процентных пунктов точности в трёх бенчмарках.
2
REALM дополняет предварительное обучение языковой модели скрытым поисковиком знаний, который извлекает документы из крупных корпусов, таких как Wikipedia, и использует их содержимое.
3
Хранение знаний через поиск обеспечивает качественные преимущества, включая повышенную интерпретируемость и модульность по сравнению с кодированием знаний только в параметрах модели.
4
Поисковик можно предварительно обучать без учителя с помощью маскированного языкового моделирования и обратного распространения через поиск по миллионам документов.

Предобучение языковой модели с дополнением извлечением (REALM) со скрытым средством поиска знаний по большому корпусу документов

Эффективность, интерпретируемость, модульность и функционирование извлечения знаний в REALM для ответов на вопросы в открытом домене

Publication Details
Publication Date
2020-02-10
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Ming‐Wei Chang
Kelvin Guu
Zora Tung
Kenton Lee
Panupong Pasupat
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%