Сравнительный анализ больших языковых моделей в генерации с дополнением извлечённой информацией

Benchmarking Large Language Models in Retrieval-Augmented Generation
Hongyu Lin, Jiawei Chen, Xianpei Han, Le Sun
2024-03-24

генерация с дополнением извлечениембенчмарк генерации с дополнением извлечениемконтрфактическая устойчивостьбольшие языковые моделиустойчивость к шуму
Генерация с дополнением извлечённой информацией (Retrieval-Augmented Generation, RAG) является перспективным подходом к снижению галлюцинаций в больших языковых моделях (Large Language Models, LLM). Однако в существующих исследованиях отсутствует строгая оценка влияния генерации с дополнением извлечённой информацией на различные большие языковые модели, что затрудняет выявление потенциальных узких мест RAG при работе с разными LLM. В данной статье систематически исследуется влияние генерации с дополнением извлечённой информацией на большие языковые модели. Анализируется эффективность различных больших языковых моделей по четырём фундаментальным способностям, необходимым для RAG: устойчивости к шуму, отклонению отрицательных утверждений, интеграции информации и устойчивости к контрфактическим данным. Для этого создан бенчмарк Retrieval-Augmented Generation Benchmark (RGB) — новый корпус для оценки RAG на английском и китайском языках. RGB разделяет примеры бенчмарка на четыре отдельные тестовые группы в соответствии с указанными фундаментальными способностями, необходимыми для решения каждого случая. Затем на RGB оцениваются шесть репрезентативных LLM для диагностики проблем, с которыми сталкиваются современные LLM при применении RAG. Оценка показывает, что, хотя LLM обладают определённой устойчивостью к шуму, они по-прежнему испытывают значительные трудности с отклонением отрицательных утверждений, интеграцией информации и обработкой ложной информации. Эти результаты свидетельствуют о том, что до эффективного применения RAG к LLM ещё предстоит проделать значительную работу.
1
Большие языковые модели демонстрируют некоторую устойчивость к шуму при извлечении, но испытывают значительные трудности с отклонением нерелевантной информации, интеграцией данных и обработкой ложной информации.
2
RGB оценивает четыре ключевые способности, необходимые для RAG: устойчивость к шуму, отклонение нерелевантных ответов, интеграцию информации и устойчивость к контрфактическим данным.
3
Результаты показывают, что современные большие языковые модели ещё далеки от надёжной поддержки эффективных приложений RAG.
4
В работе представлен RGB — двуязычный англо-китайский benchmark для систематической оценки генерации с дополнением извлечённой информацией (RAG).
5
В исследовании протестированы шесть репрезентативных больших языковых моделей для выявления специфических проблем применения RAG.

Большие языковые модели, использующие Retrieval-Augmented Generation (RAG)

их эффективность в отношении устойчивости к шуму, отклонения нерелевантной информации, интеграции информации и устойчивости к контрфактическим данным

Publication Details
Publication Date
2024-03-24
Journal
Publisher
ISSN
Cited by
374
Access Type
Author Information
Authors
Hongyu Lin
Jiawei Chen
Xianpei Han
Le Sun
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%