REALM: предварительное обучение языковой модели с дополнением за счет извлечения информации
REALM: Retrieval-Augmented Language Model Pre-Training
2020-02-10
SCID: 54.1/73jm728c
Discuss with AI
REALMлатентный извлекатель знаниймаскированное языковое моделированиевопросно-ответная система в открытом доменепредобучение языковой модели с дополнением извлечением
Figures from the paper
Abstract (AI)
Показано, что предварительное обучение языковой модели позволяет усвоить удивительно большой объем знаний о мире, необходимых для таких задач обработки естественного языка (NLP), как ответы на вопросы. Однако эти знания хранятся неявно в параметрах нейронной сети, что требует создания все более крупных сетей для охвата большего числа фактов. Чтобы представить знания более модульным и интерпретируемым способом, мы дополняем предварительное обучение языковой модели скрытым модулем извлечения знаний, который позволяет модели извлекать документы из большого корпуса, такого как Wikipedia, и учитывать их содержимое при обработке; корпус используется на этапах предварительного обучения, дообучения и вывода. Впервые мы показываем, как предварительно обучать такой модуль извлечения знаний без учителя, используя моделирование языка с маскированием в качестве обучающего сигнала и выполняя обратное распространение ошибки через этап извлечения, на котором рассматриваются миллионы документов. Мы демонстрируем эффективность предварительного обучения языковой модели с дополнением за счет извлечения информации (Retrieval-Augmented Language Model pre-training, REALM), выполняя дообучение на сложной задаче ответов на вопросы по открытой предметной области (Open-domain Question Answering, Open-QA). Мы сравниваем REALM с современными моделями, использующими как явное, так и неявное хранение знаний, на трех популярных тестах Open-QA и обнаруживаем, что превосходим все предыдущие методы с существенным отрывом (на 4–16 процентных пунктов по абсолютной точности), одновременно обеспечивая такие качественные преимущества, как интерпретируемость и модульность.
Key Findings
1
После дообучения для открытых вопросов REALM превосходит предыдущие модели с явным и неявным хранением знаний на 4–16 процентных пунктов точности в трёх бенчмарках.
2
REALM дополняет предварительное обучение языковой модели скрытым поисковиком знаний, который извлекает документы из крупных корпусов, таких как Wikipedia, и использует их содержимое.
3
Хранение знаний через поиск обеспечивает качественные преимущества, включая повышенную интерпретируемость и модульность по сравнению с кодированием знаний только в параметрах модели.
4
Поисковик можно предварительно обучать без учителя с помощью маскированного языкового моделирования и обратного распространения через поиск по миллионам документов.
Research Object
Предобучение языковой модели с дополнением извлечением (REALM) со скрытым средством поиска знаний по большому корпусу документов
Research Subject
Эффективность, интерпретируемость, модульность и функционирование извлечения знаний в REALM для ответов на вопросы в открытом домене
Publication Details
Publication Date
2020-02-10
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai2
Работы, цитирующие эту статью9
Pre-train, Prompt, and Predict: Систематический обзор методов использования подсказок в обработке естественного языка2022
Аугментация текстовых данных для глубокого обучения2021
Дополнение извлечённой информацией снижает галлюцинации в диалогах2021
Активная генерация с дополнением посредством поиска2023
Сравнительный анализ больших языковых моделей в генерации с дополнением извлечённой информацией2024
Улучшение адаптации к предметной области моделей генерации с дополнением извлечённой информацией (RAG) для ответов на вопросы в открытом домене2023
Использование поиска фрагментов текста совместно с генеративными моделями для ответов на вопросы в открытом домене2021
Интеллект, компилируемый через аффордансы: наблюдаемое сопоставление когнитивных импедансов для LLM-интегрированных систем без мета-доступа2020
Плотное извлечение фрагментов текста для ответов на вопросы в открытом домене2020