CRUD-RAG: комплексный китайский бенчмарк для генерации с дополнением извлечённой информацией большими языковыми моделями
CRUD-RAG: A Comprehensive Chinese Benchmark for Retrieval-Augmented Generation of Large Language Models
2024-10-19
SCID: 54.1/4hur3d7g
Discuss with AI
CRUD-RAGкитайский бенчмаркоценка RAG-систембольшие языковые моделигенерация с дополнением извлечением
Figures from the paper
Abstract (AI)
Генерация с дополнением извлечённой информацией (retrieval-augmented generation, RAG) — это метод, повышающий возможности больших языковых моделей (large language models, LLM) за счёт использования внешних источников знаний. Этот метод позволяет устранить распространённые ограничения LLM, включая устаревшую информацию и склонность к созданию неточного «галлюцинирующего» контента. Однако оценка систем RAG представляет собой сложную задачу. Большинство бенчмарков сосредоточено главным образом на приложениях для ответов на вопросы, оставляя без внимания другие потенциальные сценарии, в которых RAG может быть полезен. Поэтому в экспериментах с использованием таких бенчмарков часто оцениваются только компоненты LLM в конвейере RAG либо модуль извлечения в сценариях, насыщенных знаниями, тогда как влияние построения внешней базы знаний и компонента извлечения на весь конвейер RAG в сценариях, не требующих интенсивного использования знаний, остаётся без внимания. Для решения этих проблем в статье создан крупномасштабный и более комплексный бенчмарк, а также проведена оценка всех компонентов систем RAG в различных сценариях применения RAG. В частности, за основу взяты операции CRUD, описывающие взаимодействие пользователей с базами знаний; диапазон приложений RAG также разделён на четыре типа — создание, чтение, обновление и удаление (create, read, update, delete, CRUD). «Создание» относится к сценариям, требующим генерации оригинального и разнообразного контента. «Чтение» предполагает ответы на сложные вопросы в ситуациях, насыщенных знаниями. «Обновление» связано с пересмотром и исправлением неточностей или несоответствий в ранее созданных текстах. «Удаление» означает задачу суммирования объёмных текстов в более краткую форму. Для каждой из категорий CRUD разработаны отдельные наборы данных для оценки производительности систем RAG. Кроме того, проанализировано влияние различных компонентов системы RAG, таких как модуль извлечения, длина контекста, построение базы знаний и LLM. Наконец, представлены полезные рекомендации по оптимизации технологии RAG для различных сценариев. Исходный код доступен на GitHub: https://github.com/IAAR-Shanghai/CRUD_RAG.
Key Findings
1
CRUD-RAG представляет крупномасштабный китайский бенчмарк, охватывающий четыре категории применения RAG: создание, чтение, обновление и удаление.
2
В экспериментах анализируется влияние выбора ретривера, длины контекста, построения базы знаний и выбора LLM на эффективность RAG.
3
Для генерации оригинального контента, ответов на знания-зависимые вопросы, исправления текстов и суммаризации длинных текстов разработаны отдельные наборы данных.
4
Бенчмарк оценивает полные конвейеры RAG в различных сценариях, а не только ответы на вопросы, ретриверы или компоненты LLM.
5
Исследование предоставляет зависящие от сценария рекомендации по оптимизации RAG и подчеркивает важность оценки построения внешних знаний и поиска, включая задачи, не связанные напрямую с насыщенными знаниями.
Research Object
Бенчмарк CRUD-RAG и системы генерации с дополнением извлечёнными данными (RAG), оцениваемые в сценариях создания, чтения, обновления и удаления
Research Subject
Комплексная оценка сквозного конвейера RAG, включая эффективность ретривера, длину контекста, построение базы знаний и влияние LLM в различных сценариях применения
Publication Details
Publication Date
2024-10-19
Journal
Publisher
ISSN
Cited by
95
Access Type
Author Information
Download PDF
Subscribe to digest