Повышение точности результатов GPT-3/4 на биомедицинских данных с использованием языковой модели с дополнительным поиском (RAG)
Improving accuracy of GPT-3/4 results on biomedical data using a retrieval-augmented language model
2024-08-21
SCID: 54.1/cufpgtmm
Discuss with AI
GPT-3.5GPT-4Prometheus (Microsoft)точностьдиффузная большая B-клеточная лимфома (DLBCL)доменно-специфические LLMгаллюцинацииRAG для онкологических исследованийчитабельностьрелевантностьretrieval-augmented generation (RAG)
Figures from the paper
Abstract (AI)
Крупные языковые модели (LLM) оказали значительное влияние на область общей искусственной интеллекта. Универсальные LLM демонстрируют сильные логические и рассудочные навыки и обладают общими знаниями о мире, но при запросах по конкретным предметным областям иногда могут генерировать вводящие в заблуждение результаты. LLM, обученные на доменно-специфичных данных, могут снизить генерацию вводящей в заблуждение информации (т.н. галлюцинаций) и повысить точность моделей в специализированных контекстах. Однако обучение новых LLM на специфичных корпусах может требовать значительных ресурсов. В настоящем исследовании мы изучали использование модели с retrieval-augmented generation (RAG), которую протестировали на литературе, относящейся к биомедицинской области исследований. Для ответов на 19 вопросов, касающихся биологии и лечения диффузной крупноклеточной В-клеточной лимфомы (DLBCL), использовались GPT-3.5 и GPT-4 от OpenAI, Prometheus от Microsoft и собственная модель RAG. Восемь независимых рецензентов оценивали ответы LLM по точности, релевантности и читаемости, выставляя оценки по трёхбалльной шкале для каждой категории. Эти оценки использовались для сравнения производительности моделей. Результаты LLM варьировали по оценочным категориям. По показателям точности и релевантности модель RAG превзошла другие модели, показав в среднем более высокие баллы и большее количество высших оценок по вопросам. GPT-4 был более сопоставим с RAG по релевантности, чем по точности. По тем же показателям GPT-4 и GPT-3.5 получили наивысшие оценки за читаемость ответов по сравнению с другими LLM. GPT-4 и GPT-3.5 также дали больше ответов с галлюцинациями, что было обусловлено несуществующими ссылками и неточными ответами на клинические вопросы. Наши результаты свидетельствуют о том, что модель RAG, ориентированная на онкологические исследования, может превосходить универсальные LLM по точности и релевантности при ответах на предметно-специфические вопросы. Эта методика может быть адаптирована для вопросов и ответов в других предметных областях. Дальнейшие исследования помогут понять влияние архитектур LLM, методологий RAG и техник подсказок на ответы в разных предметных областях.
Key Findings
1
Модель с извлечением и генерацией (RAG), протестированная на литературе по DLBCL, превзошла общие LLM по точности и релевантности.
2
По результатам оценки восьми независимых рецензентов по 19 вопросам DLBCL (шкала 3 уровня), RAG-модель получила более высокие средние баллы и наибольшее число лучших оценок.
3
GPT-4 и GPT-3.5 давали наиболее читаемые ответы, но также чаще допускали галлюцинации, включая несуществующие ссылки и неточные клинические ответы.
4
GPT-4 был ближе к RAG по релевантности, чем по точности, что указывает на более сильные показатели релевантности при худшей точности.
5
Ориентированную на онкологические исследования RAG-структуру можно адаптировать к другим областям, указывая, что доменно-специфичное извлечение улучшает точность LLM без полного дообучения модели.
Research Object
Модель генерации с дополнением извлечением (RAG), оценённая на биомедицинской литературе по диффузной крупноклеточной В-клеточной лимфоме (DLBCL)
Research Subject
Точность, релевантность и читаемость ответов, генерируемых RAG-моделью по сравнению с универсальными LLM (GPT-3.5, GPT-4, Prometheus) при ответах на вопросы по биологии и лечению DLBCL, включая частоту галлюцинаций
Publication Details
Publication Date
2024-08-21
Journal
Publisher
ISSN
Cited by
49
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest