Извлечение с расширением клиническими сущностями для извлечения клинической информации

Clinical entity augmented retrieval for clinical information extraction
Jonathan H. Chen, Nigam H. Shah, Akshay Swaminathan, Fateme Nateghi Haredasht, Iván López, P. Stephen, Karthik S. Vedula, Sanjana Narayanan, April S. Liang, Steven Tate, Manoj Maddali, Robert J. Gallo
2025-01-19

извлечение клинической информациибольшие языковые моделиклинические сущностипоиск на основе эмбеддинговгенерация с дополненной поиском
Большие языковые модели (LLM) с генерацией, дополненной поиском (RAG), улучшили извлечение информации по сравнению с предыдущими методами, однако их зависимость от эмбеддингов часто приводит к неэффективному поиску. Мы представляем метод извлечения с расширением клиническими сущностями (Clinical Entity Augmented Retrieval, CLEAR) — конвейер RAG, который извлекает информацию с использованием сущностей. Мы сравнили CLEAR с RAG на основе эмбеддингов и подходом с использованием полной клинической записи для извлечения 18 переменных с помощью шести LLM на 20 000 клинических записей. Средние значения F1 составили 0,90, 0,86 и 0,79; время вывода — 4,95, 17,41 и 20,08 с на запись; среднее число запросов к модели — 1,68, 4,94 и 4,18 на запись; среднее количество входных токенов — 1,1 тыс., 3,8 тыс. и 6,1 тыс. на запись для CLEAR, RAG на основе эмбеддингов и подхода с использованием полной записи соответственно. В заключение, CLEAR использует клинические сущности для поиска информации и обеспечивает более чем 70%-ное сокращение использования токенов и времени вывода при повышении эффективности по сравнению с современными методами.
1
На 20 000 медицинских записей, шести LLM и 18 переменных CLEAR достиг наивысшего среднего F1: 0,90 против 0,86 для RAG на основе эмбеддингов и 0,79 для обработки полной записи.
2
CLEAR — это конвейер генерации с дополнением поиском, использующий клинические сущности для извлечения информации из медицинских текстов.
3
CLEAR сократил среднее время вывода до 4,95 секунды на запись по сравнению с 17,41 секунды для RAG на основе эмбеддингов и 20,08 секунды для полной записи.
4
CLEAR требовал меньше запросов к модели на запись: в среднем 1,68 против 4,94 для RAG на основе эмбеддингов и 4,18 для полной записи.
5
CLEAR использовал в среднем 1,1 тыс. входных токенов на запись — более чем на 70% меньше, чем RAG на основе эмбеддингов (3,8 тыс.) и подход полной записи (6,1 тыс.), одновременно повышая качество извлечения.

клинические записи, обрабатываемые для извлечения клинической информации

эффективность и эффективность по вычислительным затратам генерации с дополненной извлечением на основе сущностей при извлечении 18 клинических переменных, включая точность, время вывода, число запросов к модели и использование токенов

Publication Details
Publication Date
2025-01-19
Journal
Publisher
ISSN
Cited by
67
Access Type
Author Information
Authors
Jonathan H. Chen
Nigam H. Shah
Akshay Swaminathan
Fateme Nateghi Haredasht
Iván López
P. Stephen
Karthik S. Vedula
Sanjana Narayanan
April S. Liang
Steven Tate
Manoj Maddali
Robert J. Gallo
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%