Повышение точности результатов GPT-3/4 на биомедицинских данных с использованием языковой модели с дополнительным поиском (RAG)

Improving accuracy of GPT-3/4 results on biomedical data using a retrieval-augmented language model
Brandon W. Higgs, David S. Soong, Sriram Sridhar, Han Si, Jan-Samuel Wagner, Ana Caroline C. Sá, Christina Y. Yu, Kübra Karagoz, Meijian Guan, Sanyam Kumar, Hisham K. Hamadeh
2024-08-21

GPT-3.5GPT-4Prometheus (Microsoft)точностьдиффузная большая B-клеточная лимфома (DLBCL)доменно-специфические LLMгаллюцинацииRAG для онкологических исследованийчитабельностьрелевантностьretrieval-augmented generation (RAG)
Крупные языковые модели (LLM) оказали значительное влияние на область общей искусственной интеллекта. Универсальные LLM демонстрируют сильные логические и рассудочные навыки и обладают общими знаниями о мире, но при запросах по конкретным предметным областям иногда могут генерировать вводящие в заблуждение результаты. LLM, обученные на доменно-специфичных данных, могут снизить генерацию вводящей в заблуждение информации (т.н. галлюцинаций) и повысить точность моделей в специализированных контекстах. Однако обучение новых LLM на специфичных корпусах может требовать значительных ресурсов. В настоящем исследовании мы изучали использование модели с retrieval-augmented generation (RAG), которую протестировали на литературе, относящейся к биомедицинской области исследований. Для ответов на 19 вопросов, касающихся биологии и лечения диффузной крупноклеточной В-клеточной лимфомы (DLBCL), использовались GPT-3.5 и GPT-4 от OpenAI, Prometheus от Microsoft и собственная модель RAG. Восемь независимых рецензентов оценивали ответы LLM по точности, релевантности и читаемости, выставляя оценки по трёхбалльной шкале для каждой категории. Эти оценки использовались для сравнения производительности моделей. Результаты LLM варьировали по оценочным категориям. По показателям точности и релевантности модель RAG превзошла другие модели, показав в среднем более высокие баллы и большее количество высших оценок по вопросам. GPT-4 был более сопоставим с RAG по релевантности, чем по точности. По тем же показателям GPT-4 и GPT-3.5 получили наивысшие оценки за читаемость ответов по сравнению с другими LLM. GPT-4 и GPT-3.5 также дали больше ответов с галлюцинациями, что было обусловлено несуществующими ссылками и неточными ответами на клинические вопросы. Наши результаты свидетельствуют о том, что модель RAG, ориентированная на онкологические исследования, может превосходить универсальные LLM по точности и релевантности при ответах на предметно-специфические вопросы. Эта методика может быть адаптирована для вопросов и ответов в других предметных областях. Дальнейшие исследования помогут понять влияние архитектур LLM, методологий RAG и техник подсказок на ответы в разных предметных областях.
1
Модель с извлечением и генерацией (RAG), протестированная на литературе по DLBCL, превзошла общие LLM по точности и релевантности.
2
По результатам оценки восьми независимых рецензентов по 19 вопросам DLBCL (шкала 3 уровня), RAG-модель получила более высокие средние баллы и наибольшее число лучших оценок.
3
GPT-4 и GPT-3.5 давали наиболее читаемые ответы, но также чаще допускали галлюцинации, включая несуществующие ссылки и неточные клинические ответы.
4
GPT-4 был ближе к RAG по релевантности, чем по точности, что указывает на более сильные показатели релевантности при худшей точности.
5
Ориентированную на онкологические исследования RAG-структуру можно адаптировать к другим областям, указывая, что доменно-специфичное извлечение улучшает точность LLM без полного дообучения модели.

Модель генерации с дополнением извлечением (RAG), оценённая на биомедицинской литературе по диффузной крупноклеточной В-клеточной лимфоме (DLBCL)

Точность, релевантность и читаемость ответов, генерируемых RAG-моделью по сравнению с универсальными LLM (GPT-3.5, GPT-4, Prometheus) при ответах на вопросы по биологии и лечению DLBCL, включая частоту галлюцинаций

Publication Details
Publication Date
2024-08-21
Journal
Publisher
ISSN
Cited by
49
Access Type
Author Information
Authors
Brandon W. Higgs
David S. Soong
Sriram Sridhar
Han Si
Jan-Samuel Wagner
Ana Caroline C. Sá
Christina Y. Yu
Kübra Karagoz
Meijian Guan
Sanyam Kumar
Hisham K. Hamadeh
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%