Сравнительный анализ больших языковых моделей в генерации с дополнением извлечённой информацией
Benchmarking Large Language Models in Retrieval-Augmented Generation
2024-03-24
SCID: 54.1/epde4uqw
Discuss with AI
генерация с дополнением извлечениембенчмарк генерации с дополнением извлечениемконтрфактическая устойчивостьбольшие языковые моделиустойчивость к шуму
Figures from the paper
Abstract (AI)
Генерация с дополнением извлечённой информацией (Retrieval-Augmented Generation, RAG) является перспективным подходом к снижению галлюцинаций в больших языковых моделях (Large Language Models, LLM). Однако в существующих исследованиях отсутствует строгая оценка влияния генерации с дополнением извлечённой информацией на различные большие языковые модели, что затрудняет выявление потенциальных узких мест RAG при работе с разными LLM. В данной статье систематически исследуется влияние генерации с дополнением извлечённой информацией на большие языковые модели. Анализируется эффективность различных больших языковых моделей по четырём фундаментальным способностям, необходимым для RAG: устойчивости к шуму, отклонению отрицательных утверждений, интеграции информации и устойчивости к контрфактическим данным. Для этого создан бенчмарк Retrieval-Augmented Generation Benchmark (RGB) — новый корпус для оценки RAG на английском и китайском языках. RGB разделяет примеры бенчмарка на четыре отдельные тестовые группы в соответствии с указанными фундаментальными способностями, необходимыми для решения каждого случая. Затем на RGB оцениваются шесть репрезентативных LLM для диагностики проблем, с которыми сталкиваются современные LLM при применении RAG. Оценка показывает, что, хотя LLM обладают определённой устойчивостью к шуму, они по-прежнему испытывают значительные трудности с отклонением отрицательных утверждений, интеграцией информации и обработкой ложной информации. Эти результаты свидетельствуют о том, что до эффективного применения RAG к LLM ещё предстоит проделать значительную работу.
Key Findings
1
Большие языковые модели демонстрируют некоторую устойчивость к шуму при извлечении, но испытывают значительные трудности с отклонением нерелевантной информации, интеграцией данных и обработкой ложной информации.
2
RGB оценивает четыре ключевые способности, необходимые для RAG: устойчивость к шуму, отклонение нерелевантных ответов, интеграцию информации и устойчивость к контрфактическим данным.
3
Результаты показывают, что современные большие языковые модели ещё далеки от надёжной поддержки эффективных приложений RAG.
4
В работе представлен RGB — двуязычный англо-китайский benchmark для систематической оценки генерации с дополнением извлечённой информацией (RAG).
5
В исследовании протестированы шесть репрезентативных больших языковых моделей для выявления специфических проблем применения RAG.
Research Object
Большие языковые модели, использующие Retrieval-Augmented Generation (RAG)
Research Subject
их эффективность в отношении устойчивости к шуму, отклонения нерелевантной информации, интеграции информации и устойчивости к контрфактическим данным
Publication Details
Publication Date
2024-03-24
Journal
Publisher
ISSN
Cited by
374
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai6
Atlas: обучение по небольшому числу примеров с использованием языковых моделей, дополненных извлечением информации2022
Chatlaw: многоагентный юридический ассистент на основе архитектуры смеси экспертов, согласованной с ролями2026
Использование поиска фрагментов текста совместно с генеративными моделями для ответов на вопросы в открытом домене2021
Интеллект, компилируемый через аффордансы: наблюдаемое сопоставление когнитивных импедансов для LLM-интегрированных систем без мета-доступа2020
REALM: предварительное обучение языковой модели с дополнением за счет извлечения информации2020
Генерация ответов в диалоге с использованием поиска руководящих примеров через фреймворк «сопоставление‑к‑генерации»2019
Работы, цитирующие эту статью3
Генеративные агенты искусственного интеллекта с большими языковыми моделями для спутниковых сетей посредством передачи на основе смеси экспертов2024
Чат-боты на основе генерации с дополнением извлечёнными данными (RAG) в образовании: обзор применений2025
Генеративный ИИ и будущее демократического гражданства2024