Бенчмаркинг генерации с дополнением извлечённой информацией в медицине
Benchmarking Retrieval-Augmented Generation for Medicine
2024-01-01
SCID: 54.1/7474bj5w
Discuss with AI
инструментарий MEDRAGбенчмарк MIRAGEэффект «потерянного в середине»медицинские вопросы и ответымедицинская генерация с дополнением поиска
Figures from the paper
Abstract (AI)
Несмотря на то что большие языковые модели (LLM) демонстрируют передовые результаты в широком спектре задач медицинских вопросов и ответов (QA), они по-прежнему сталкиваются с проблемами галлюцинаций и устаревших знаний. Генерация с дополнением извлечённой информацией (RAG) является перспективным решением и получила широкое распространение. Однако система RAG может включать множество гибко настраиваемых компонентов, при этом отсутствуют лучшие практики выбора оптимальной конфигурации RAG для различных медицинских задач. Для систематической оценки таких систем мы предлагаем Medical Information Retrieval-Augmented Generation Evaluation (MIRAGE) — первый в своём роде бенчмарк, включающий 7 663 вопроса из пяти наборов данных по медицинским вопросам и ответам. С использованием MIRAGE мы провели крупномасштабные эксперименты, охватившие более 1,8 триллиона токенов промптов и 41 комбинацию различных корпусов, средств извлечения и базовых больших языковых моделей посредством представленного в этой работе инструментария MEDRAG. В целом MEDRAG повышает точность шести различных LLM до 18% по сравнению с формированием запросов с пошаговым рассуждением, доводя показатели GPT-3.5 и Mixtral до уровня GPT-4. Наши результаты показывают, что наилучшие показатели достигаются при сочетании различных медицинских корпусов и средств извлечения. Кроме того, мы выявили лог-линейное свойство масштабирования и эффекты «потери в середине» в медицинских RAG-системах. Мы считаем, что наши всесторонние оценки могут служить практическими рекомендациями по внедрению RAG-систем в медицине.
Key Findings
1
Для шести языковых моделей MEDRAG повышает точность до 18% по сравнению с пошаговым рассуждением, доводя результаты GPT-3.5 и Mixtral до уровня GPT-4.
2
Сочетание нескольких медицинских корпусов и поисковых систем обеспечивает наилучшие общие результаты медицинских RAG-систем.
3
В медицинских RAG-системах выявлены лог-линейное масштабирование и эффект «потери в середине», указывающие на важные ограничения поиска и контекстов.
4
Инструментарий MEDRAG обеспечивает масштабную оценку 41 комбинации медицинских корпусов, поисковых систем и базовых больших языковых моделей.
5
Бенчмарк MIRAGE оценивает генерацию с дополненным поиском в медицине на 7 663 вопросах из пяти наборов данных для медицинских вопросов и ответов.
Research Object
медицинские системы генерации с дополненным поиском (RAG) для ответов на вопросы с использованием больших языковых моделей
Research Subject
влияние конфигураций корпусов, поисковых модулей и базовых больших языковых моделей на точность ответов на медицинские вопросы, включая закономерности масштабирования и эффект «потери в середине»
Publication Details
Publication Date
2024-01-01
Journal
Publisher
ISSN
Cited by
257
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest