Промпт-инжиниринг для обеспечения согласованности и надежности ответов больших языковых моделей в соответствии с доказательными рекомендациями
Prompt engineering in consistency and reliability with the evidence-based guideline for LLMs
2024-02-20
SCID: 54.1/w8ew8vnu
Discuss with AI
Согласованность и надежностьКаппа ФлейссаБольшие языковые моделиРекомендации по остеоартритуПромпт-инжиниринг
Figures from the paper
Abstract (AI)
В настоящее время применение больших языковых моделей (LLM) в клинической медицине активно развивается. Крайне важно эффективно перенести релевантные теоретические знания о LLM из области компьютерных наук в практику их применения в клинической медицине. Промпт-инжиниринг продемонстрировал потенциал как эффективный метод для этой цели. Для изучения применения промпт-инжиниринга к LLM и оценки их надежности были разработаны различные стили промптов; с их помощью разным LLM задавали вопросы о соответствии их ответов доказательным рекомендациям Американской академии хирургов-ортопедов (AAOS) по остеоартриту (OA). Каждый вопрос задавали пять раз. Мы сравнивали согласованность результатов с рекомендациями при различных уровнях доказательности и типах промптов, а также оценивали надежность разных промптов, задавая один и тот же вопрос пять раз. GPT-4-Web с использованием промпта ROT продемонстрировала наибольшую общую согласованность (62,9%) и значимо лучшие результаты для строгих рекомендаций; общая согласованность составила 77,5%. Надежность различных LLM при использовании разных промптов была нестабильной (каппа Флейсса варьировала от −0,002 до 0,984). Это исследование показало, что разные промпты оказывают неодинаковое влияние на различные модели, а GPT-4-Web с промптом ROT была наиболее согласованной. Использование подходящего промпта может повысить точность ответов на профессиональные медицинские вопросы.
Key Findings
1
Каждый клинический вопрос задавался пять раз для оценки согласованности с руководством и надёжности ответов различных моделей и промптов.
2
GPT-4-Web с использованием промпта ROT продемонстрировала наивысшую общую согласованность с рекомендациями — 62,9%.
3
Для сильных рекомендаций GPT-4-Web с промптом ROT достигла согласованности 77,5%.
4
Надёжность LLM существенно варьировала в зависимости от модели и промпта: значения каппа Флисса составляли от -0,002 до 0,984; влияние промптов было нестабильным между моделями.
5
В исследовании оценивалось, как стили промптов влияют на согласованность ответов LLM с доказательными рекомендациями AAOS по остеоартриту при разных уровнях силы рекомендаций.
Research Object
Промпт-инжиниринг, применённый к большим языковым моделям (LLM) для запросов по доказательным рекомендациям AAOS по остеоартриту
Research Subject
согласованность и надёжность ответов больших языковых моделей при разных стилях промптов, моделях и повторных запросах, включая соответствие уровням доказательности рекомендаций
Publication Details
Publication Date
2024-02-20
Journal
Publisher
ISSN
Cited by
378
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest