Оценка качества извлечения в системах генерации с дополненным извлечением
Evaluating Retrieval Quality in Retrieval-Augmented Generation
2024-07-10
SCID: 54.1/x67vtw5f
Discuss with AI
корреляция Кендалларелевантность на уровне документовeRAGоценка качества поискагенерация с дополнением поиска
Figures from the paper
Abstract (AI)
Оценка генерации с дополненным извлечением (RAG) сопряжена с рядом трудностей, особенно в отношении моделей извлечения, используемых в таких системах. Традиционные методы сквозной оценки требуют значительных вычислительных ресурсов. Кроме того, оценка эффективности модели извлечения на основе меток релевантности «запрос—документ» демонстрирует слабую корреляцию с последующей эффективностью системы RAG. Мы предлагаем новый подход к оценке — eRAG, в рамках которого каждый документ из списка извлечённых документов индивидуально используется большой языковой моделью в составе системы RAG. Затем сгенерированный для каждого документа результат оценивается на основе эталонных меток последующей задачи. Таким образом, последующая эффективность для каждого документа служит его меткой релевантности. Мы используем различные метрики последующей задачи для получения аннотаций на уровне документов и агрегируем их с помощью метрических показателей на основе множеств или ранжирования. Масштабные эксперименты на широком спектре наборов данных показывают, что eRAG обеспечивает более высокую корреляцию с последующей эффективностью RAG по сравнению с базовыми методами; улучшение корреляции Кендалла тау составляет от 0.168 до 0.494. Кроме того, eRAG обладает значительными вычислительными преимуществами: сокращает время выполнения и требует до 50 раз меньше памяти GPU по сравнению со сквозной оценкой.
Key Findings
1
На разнообразных наборах данных eRAG сильнее коррелирует с качеством RAG-системы, чем базовые методы; улучшение корреляции Кендалла составляет 0,168–0,494.
2
Метод формирует оценки релевантности документов с помощью метрик конечной задачи и эталонных ответов, а не традиционных меток релевантности «запрос—документ».
3
eRAG оценивает качество поиска, подавая каждый найденный документ отдельно в языковую модель и размечая его на основе качества выполнения конечной задачи.
4
По сравнению с сквозной оценкой eRAG существенно снижает вычислительные затраты: ускоряет выполнение и потребляет до 50 раз меньше памяти GPU.
Research Object
модели поиска в системах генерации с дополнением поиска (RAG)
Research Subject
корреляция между оценками релевантности поиска на уровне документов и эффективностью RAG на последующей задаче, включая эффективность оценки
Publication Details
Publication Date
2024-07-10
Journal
Publisher
ISSN
Cited by
146
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest