Промпт-инжиниринг для обеспечения согласованности и надежности ответов больших языковых моделей в соответствии с доказательными рекомендациями

Prompt engineering in consistency and reliability with the evidence-based guideline for LLMs
Jian Li, Xi Chen, Xiangwen Deng, Wang Li, Hao Wen, Mingke You, Weizhi Liu, Qi Li
2024-02-20

Согласованность и надежностьКаппа ФлейссаБольшие языковые моделиРекомендации по остеоартритуПромпт-инжиниринг
В настоящее время применение больших языковых моделей (LLM) в клинической медицине активно развивается. Крайне важно эффективно перенести релевантные теоретические знания о LLM из области компьютерных наук в практику их применения в клинической медицине. Промпт-инжиниринг продемонстрировал потенциал как эффективный метод для этой цели. Для изучения применения промпт-инжиниринга к LLM и оценки их надежности были разработаны различные стили промптов; с их помощью разным LLM задавали вопросы о соответствии их ответов доказательным рекомендациям Американской академии хирургов-ортопедов (AAOS) по остеоартриту (OA). Каждый вопрос задавали пять раз. Мы сравнивали согласованность результатов с рекомендациями при различных уровнях доказательности и типах промптов, а также оценивали надежность разных промптов, задавая один и тот же вопрос пять раз. GPT-4-Web с использованием промпта ROT продемонстрировала наибольшую общую согласованность (62,9%) и значимо лучшие результаты для строгих рекомендаций; общая согласованность составила 77,5%. Надежность различных LLM при использовании разных промптов была нестабильной (каппа Флейсса варьировала от −0,002 до 0,984). Это исследование показало, что разные промпты оказывают неодинаковое влияние на различные модели, а GPT-4-Web с промптом ROT была наиболее согласованной. Использование подходящего промпта может повысить точность ответов на профессиональные медицинские вопросы.
1
Каждый клинический вопрос задавался пять раз для оценки согласованности с руководством и надёжности ответов различных моделей и промптов.
2
GPT-4-Web с использованием промпта ROT продемонстрировала наивысшую общую согласованность с рекомендациями — 62,9%.
3
Для сильных рекомендаций GPT-4-Web с промптом ROT достигла согласованности 77,5%.
4
Надёжность LLM существенно варьировала в зависимости от модели и промпта: значения каппа Флисса составляли от -0,002 до 0,984; влияние промптов было нестабильным между моделями.
5
В исследовании оценивалось, как стили промптов влияют на согласованность ответов LLM с доказательными рекомендациями AAOS по остеоартриту при разных уровнях силы рекомендаций.

Промпт-инжиниринг, применённый к большим языковым моделям (LLM) для запросов по доказательным рекомендациям AAOS по остеоартриту

согласованность и надёжность ответов больших языковых моделей при разных стилях промптов, моделях и повторных запросах, включая соответствие уровням доказательности рекомендаций

Publication Details
Publication Date
2024-02-20
Journal
Publisher
ISSN
Cited by
378
Access Type
Author Information
Authors
Jian Li
Xi Chen
Xiangwen Deng
Wang Li
Hao Wen
Mingke You
Weizhi Liu
Qi Li
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%