Извлечение с расширением клиническими сущностями для извлечения клинической информации
Clinical entity augmented retrieval for clinical information extraction
2025-01-19
SCID: 54.1/hysa6gbu
Discuss with AI
извлечение клинической информациибольшие языковые моделиклинические сущностипоиск на основе эмбеддинговгенерация с дополненной поиском
Figures from the paper
Abstract (AI)
Большие языковые модели (LLM) с генерацией, дополненной поиском (RAG), улучшили извлечение информации по сравнению с предыдущими методами, однако их зависимость от эмбеддингов часто приводит к неэффективному поиску. Мы представляем метод извлечения с расширением клиническими сущностями (Clinical Entity Augmented Retrieval, CLEAR) — конвейер RAG, который извлекает информацию с использованием сущностей. Мы сравнили CLEAR с RAG на основе эмбеддингов и подходом с использованием полной клинической записи для извлечения 18 переменных с помощью шести LLM на 20 000 клинических записей. Средние значения F1 составили 0,90, 0,86 и 0,79; время вывода — 4,95, 17,41 и 20,08 с на запись; среднее число запросов к модели — 1,68, 4,94 и 4,18 на запись; среднее количество входных токенов — 1,1 тыс., 3,8 тыс. и 6,1 тыс. на запись для CLEAR, RAG на основе эмбеддингов и подхода с использованием полной записи соответственно. В заключение, CLEAR использует клинические сущности для поиска информации и обеспечивает более чем 70%-ное сокращение использования токенов и времени вывода при повышении эффективности по сравнению с современными методами.
Key Findings
1
На 20 000 медицинских записей, шести LLM и 18 переменных CLEAR достиг наивысшего среднего F1: 0,90 против 0,86 для RAG на основе эмбеддингов и 0,79 для обработки полной записи.
2
CLEAR — это конвейер генерации с дополнением поиском, использующий клинические сущности для извлечения информации из медицинских текстов.
3
CLEAR сократил среднее время вывода до 4,95 секунды на запись по сравнению с 17,41 секунды для RAG на основе эмбеддингов и 20,08 секунды для полной записи.
4
CLEAR требовал меньше запросов к модели на запись: в среднем 1,68 против 4,94 для RAG на основе эмбеддингов и 4,18 для полной записи.
5
CLEAR использовал в среднем 1,1 тыс. входных токенов на запись — более чем на 70% меньше, чем RAG на основе эмбеддингов (3,8 тыс.) и подход полной записи (6,1 тыс.), одновременно повышая качество извлечения.
Research Object
клинические записи, обрабатываемые для извлечения клинической информации
Research Subject
эффективность и эффективность по вычислительным затратам генерации с дополненной извлечением на основе сущностей при извлечении 18 клинических переменных, включая точность, время вывода, число запросов к модели и использование токенов
Publication Details
Publication Date
2025-01-19
Journal
Publisher
ISSN
Cited by
67
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest