CRUD-RAG: комплексный китайский бенчмарк для генерации с дополнением извлечённой информацией большими языковыми моделями

CRUD-RAG: A Comprehensive Chinese Benchmark for Retrieval-Augmented Generation of Large Language Models
Tong Xu, Enhong Chen, Feiyu Xiong, Hao Wu, Yuanjie Lyu, Zhiyu Li, Simin Niu, Bo Tang, Wenjin Wang, Huanyong Liu
2024-10-19

CRUD-RAGкитайский бенчмаркоценка RAG-систембольшие языковые моделигенерация с дополнением извлечением
Генерация с дополнением извлечённой информацией (retrieval-augmented generation, RAG) — это метод, повышающий возможности больших языковых моделей (large language models, LLM) за счёт использования внешних источников знаний. Этот метод позволяет устранить распространённые ограничения LLM, включая устаревшую информацию и склонность к созданию неточного «галлюцинирующего» контента. Однако оценка систем RAG представляет собой сложную задачу. Большинство бенчмарков сосредоточено главным образом на приложениях для ответов на вопросы, оставляя без внимания другие потенциальные сценарии, в которых RAG может быть полезен. Поэтому в экспериментах с использованием таких бенчмарков часто оцениваются только компоненты LLM в конвейере RAG либо модуль извлечения в сценариях, насыщенных знаниями, тогда как влияние построения внешней базы знаний и компонента извлечения на весь конвейер RAG в сценариях, не требующих интенсивного использования знаний, остаётся без внимания. Для решения этих проблем в статье создан крупномасштабный и более комплексный бенчмарк, а также проведена оценка всех компонентов систем RAG в различных сценариях применения RAG. В частности, за основу взяты операции CRUD, описывающие взаимодействие пользователей с базами знаний; диапазон приложений RAG также разделён на четыре типа — создание, чтение, обновление и удаление (create, read, update, delete, CRUD). «Создание» относится к сценариям, требующим генерации оригинального и разнообразного контента. «Чтение» предполагает ответы на сложные вопросы в ситуациях, насыщенных знаниями. «Обновление» связано с пересмотром и исправлением неточностей или несоответствий в ранее созданных текстах. «Удаление» означает задачу суммирования объёмных текстов в более краткую форму. Для каждой из категорий CRUD разработаны отдельные наборы данных для оценки производительности систем RAG. Кроме того, проанализировано влияние различных компонентов системы RAG, таких как модуль извлечения, длина контекста, построение базы знаний и LLM. Наконец, представлены полезные рекомендации по оптимизации технологии RAG для различных сценариев. Исходный код доступен на GitHub: https://github.com/IAAR-Shanghai/CRUD_RAG.
1
CRUD-RAG представляет крупномасштабный китайский бенчмарк, охватывающий четыре категории применения RAG: создание, чтение, обновление и удаление.
2
В экспериментах анализируется влияние выбора ретривера, длины контекста, построения базы знаний и выбора LLM на эффективность RAG.
3
Для генерации оригинального контента, ответов на знания-зависимые вопросы, исправления текстов и суммаризации длинных текстов разработаны отдельные наборы данных.
4
Бенчмарк оценивает полные конвейеры RAG в различных сценариях, а не только ответы на вопросы, ретриверы или компоненты LLM.
5
Исследование предоставляет зависящие от сценария рекомендации по оптимизации RAG и подчеркивает важность оценки построения внешних знаний и поиска, включая задачи, не связанные напрямую с насыщенными знаниями.

Бенчмарк CRUD-RAG и системы генерации с дополнением извлечёнными данными (RAG), оцениваемые в сценариях создания, чтения, обновления и удаления

Комплексная оценка сквозного конвейера RAG, включая эффективность ретривера, длину контекста, построение базы знаний и влияние LLM в различных сценариях применения

Publication Details
Publication Date
2024-10-19
Journal
Publisher
ISSN
Cited by
95
Access Type
Author Information
Authors
Tong Xu
Enhong Chen
Feiyu Xiong
Hao Wu
Yuanjie Lyu
Zhiyu Li
Simin Niu
Bo Tang
Wenjin Wang
Huanyong Liu
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%