Бенчмаркинг генерации с дополнением извлечённой информацией в медицине

Benchmarking Retrieval-Augmented Generation for Medicine
Zhiyong Lu, Qiao Jin, Guangzhi Xiong, Aidong Zhang
2024-01-01

инструментарий MEDRAGбенчмарк MIRAGEэффект «потерянного в середине»медицинские вопросы и ответымедицинская генерация с дополнением поиска
Несмотря на то что большие языковые модели (LLM) демонстрируют передовые результаты в широком спектре задач медицинских вопросов и ответов (QA), они по-прежнему сталкиваются с проблемами галлюцинаций и устаревших знаний. Генерация с дополнением извлечённой информацией (RAG) является перспективным решением и получила широкое распространение. Однако система RAG может включать множество гибко настраиваемых компонентов, при этом отсутствуют лучшие практики выбора оптимальной конфигурации RAG для различных медицинских задач. Для систематической оценки таких систем мы предлагаем Medical Information Retrieval-Augmented Generation Evaluation (MIRAGE) — первый в своём роде бенчмарк, включающий 7 663 вопроса из пяти наборов данных по медицинским вопросам и ответам. С использованием MIRAGE мы провели крупномасштабные эксперименты, охватившие более 1,8 триллиона токенов промптов и 41 комбинацию различных корпусов, средств извлечения и базовых больших языковых моделей посредством представленного в этой работе инструментария MEDRAG. В целом MEDRAG повышает точность шести различных LLM до 18% по сравнению с формированием запросов с пошаговым рассуждением, доводя показатели GPT-3.5 и Mixtral до уровня GPT-4. Наши результаты показывают, что наилучшие показатели достигаются при сочетании различных медицинских корпусов и средств извлечения. Кроме того, мы выявили лог-линейное свойство масштабирования и эффекты «потери в середине» в медицинских RAG-системах. Мы считаем, что наши всесторонние оценки могут служить практическими рекомендациями по внедрению RAG-систем в медицине.
1
Для шести языковых моделей MEDRAG повышает точность до 18% по сравнению с пошаговым рассуждением, доводя результаты GPT-3.5 и Mixtral до уровня GPT-4.
2
Сочетание нескольких медицинских корпусов и поисковых систем обеспечивает наилучшие общие результаты медицинских RAG-систем.
3
В медицинских RAG-системах выявлены лог-линейное масштабирование и эффект «потери в середине», указывающие на важные ограничения поиска и контекстов.
4
Инструментарий MEDRAG обеспечивает масштабную оценку 41 комбинации медицинских корпусов, поисковых систем и базовых больших языковых моделей.
5
Бенчмарк MIRAGE оценивает генерацию с дополненным поиском в медицине на 7 663 вопросах из пяти наборов данных для медицинских вопросов и ответов.

медицинские системы генерации с дополненным поиском (RAG) для ответов на вопросы с использованием больших языковых моделей

влияние конфигураций корпусов, поисковых модулей и базовых больших языковых моделей на точность ответов на медицинские вопросы, включая закономерности масштабирования и эффект «потери в середине»

Publication Details
Publication Date
2024-01-01
Journal
Publisher
ISSN
Cited by
257
Access Type
Author Information
Authors
Zhiyong Lu
Qiao Jin
Guangzhi Xiong
Aidong Zhang
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%