RocketQA: оптимизированный подход к обучению для плотного поиска фрагментов текста в системах ответов на вопросы в открытом домене
RocketQA: An Optimized Training Approach to Dense Passage Retrieval for Open-Domain Question Answering
2020-10-16
SCID: 54.1/nyt34mc6
Discuss with AI
RocketQAнегативные примеры между пакетамиплотный поиск отрывковархитектура с двумя кодировщикамиоткрытая вопросно-ответная система
Figures from the paper
Abstract (AI)
В системах ответов на вопросы в открытом домене плотный поиск фрагментов текста стал новой парадигмой поиска релевантных фрагментов для нахождения ответов. Как правило, для семантического сопоставления используется архитектура с двумя кодировщиками, обучаемая формировать плотные представления вопросов и фрагментов текста. Однако эффективное обучение двухкодировочной архитектуры затруднено рядом факторов, включая расхождение между обучением и инференсом, наличие неразмеченных положительных примеров и ограниченный объем обучающих данных. Для решения этих проблем мы предлагаем оптимизированный подход к обучению RocketQA, предназначенный для улучшения плотного поиска фрагментов текста. В RocketQA реализованы три основных технических нововведения: отрицательные примеры из межпакетного контекста, очищенные сложные отрицательные примеры и расширение данных. Результаты экспериментов показывают, что RocketQA значительно превосходит предыдущие модели, демонстрировавшие наилучшие результаты, как на наборе данных MSMARCO, так и на наборе Natural Questions. Мы также провели обширные эксперименты для оценки эффективности трех стратегий RocketQA. Кроме того, показано, что эффективность сквозной системы ответов на вопросы может быть повышена с помощью предложенного поискового модуля RocketQA.
Key Findings
1
Серия расширенных экспериментов оценивает эффективность стратегий RocketQA: межбатчевых отрицательных примеров, очищенных сложных отрицательных примеров и расширения данных.
2
Эксперименты показывают, что RocketQA значительно превосходит предыдущие модели, достигшие наилучших результатов, на наборах данных MSMARCO и Natural Questions.
3
RocketQA объединяет отрицательные примеры из других элементов батча, очищенные сложные отрицательные примеры и расширение данных как три основных технических вклада.
4
RocketQA представляет оптимизированный подход к обучению плотного поиска passages, устраняющий расхождение между обучением и выводом, наличие неразмеченных положительных примеров и недостаток обучающих данных.
5
Использование RocketQA в качестве поискового модуля повышает качество сквозной системы открытого вопросно-ответного поиска.
Research Object
плотный поиск фрагментов текста для ответов на вопросы в открытом домене
Research Subject
оптимизированное обучение двухкодировочной модели для повышения эффективности поиска в условиях расхождения между обучением и выводом, наличия неразмеченных положительных примеров и ограниченного объёма обучающих данных
Publication Details
Publication Date
2020-10-16
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest