RocketQA: оптимизированный подход к обучению для плотного поиска фрагментов текста в системах ответов на вопросы в открытом домене

RocketQA: An Optimized Training Approach to Dense Passage Retrieval for Open-Domain Question Answering
Wayne Xin Zhao, Haifeng Wang, Hua Wu, Yingqi Qu, Yuchen Ding, Jing Liu, Ruiyang Ren, Daxiang Dong, Kai Liu
2020-10-16

RocketQAнегативные примеры между пакетамиплотный поиск отрывковархитектура с двумя кодировщикамиоткрытая вопросно-ответная система
В системах ответов на вопросы в открытом домене плотный поиск фрагментов текста стал новой парадигмой поиска релевантных фрагментов для нахождения ответов. Как правило, для семантического сопоставления используется архитектура с двумя кодировщиками, обучаемая формировать плотные представления вопросов и фрагментов текста. Однако эффективное обучение двухкодировочной архитектуры затруднено рядом факторов, включая расхождение между обучением и инференсом, наличие неразмеченных положительных примеров и ограниченный объем обучающих данных. Для решения этих проблем мы предлагаем оптимизированный подход к обучению RocketQA, предназначенный для улучшения плотного поиска фрагментов текста. В RocketQA реализованы три основных технических нововведения: отрицательные примеры из межпакетного контекста, очищенные сложные отрицательные примеры и расширение данных. Результаты экспериментов показывают, что RocketQA значительно превосходит предыдущие модели, демонстрировавшие наилучшие результаты, как на наборе данных MSMARCO, так и на наборе Natural Questions. Мы также провели обширные эксперименты для оценки эффективности трех стратегий RocketQA. Кроме того, показано, что эффективность сквозной системы ответов на вопросы может быть повышена с помощью предложенного поискового модуля RocketQA.
1
Серия расширенных экспериментов оценивает эффективность стратегий RocketQA: межбатчевых отрицательных примеров, очищенных сложных отрицательных примеров и расширения данных.
2
Эксперименты показывают, что RocketQA значительно превосходит предыдущие модели, достигшие наилучших результатов, на наборах данных MSMARCO и Natural Questions.
3
RocketQA объединяет отрицательные примеры из других элементов батча, очищенные сложные отрицательные примеры и расширение данных как три основных технических вклада.
4
RocketQA представляет оптимизированный подход к обучению плотного поиска passages, устраняющий расхождение между обучением и выводом, наличие неразмеченных положительных примеров и недостаток обучающих данных.
5
Использование RocketQA в качестве поискового модуля повышает качество сквозной системы открытого вопросно-ответного поиска.

плотный поиск фрагментов текста для ответов на вопросы в открытом домене

оптимизированное обучение двухкодировочной модели для повышения эффективности поиска в условиях расхождения между обучением и выводом, наличия неразмеченных положительных примеров и ограниченного объёма обучающих данных

Publication Details
Publication Date
2020-10-16
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Wayne Xin Zhao
Haifeng Wang
Hua Wu
Yingqi Qu
Yuchen Ding
Jing Liu
Ruiyang Ren
Daxiang Dong
Kai Liu
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat →
Make a presentation
100%