Структурированное извлечение информации из научных текстов с помощью больших языковых моделей

Structured information extraction from scientific text with large language models
Kristin A. Persson, Gerbrand Ceder, John Dagdelen, Anubhav Jain, Nicholas Walker, Sang‐Hoon Lee, Alexander Dunn, Andrew Rosen
2024-02-15

совместное распознавание именованных сущностей и извлечение отношенийбольшие языковые моделихимия материаловметаллоорганические каркасыструктурированное извлечение информации
Извлечение структурированных знаний из научных текстов остается сложной задачей для моделей машинного обучения. В данной работе представлен простой подход к совместному распознаванию именованных сущностей и извлечению отношений, а также показано, как предварительно обученные большие языковые модели (GPT-3, Llama-2) можно дообучать для извлечения полезных записей, содержащих сложные научные знания. Мы рассматриваем три репрезентативные задачи в химии материалов: установление связей между легирующими добавками и матричными материалами, составление каталогов металлоорганических каркасов и общее извлечение информации о составе, фазе, морфологии и применении. Записи извлекаются из отдельных предложений или целых абзацев, а результат может быть представлен в виде простых предложений на английском языке или в более структурированном формате, например в виде списка объектов JSON. Этот подход представляет собой простой, доступный и чрезвычайно гибкий способ получения крупных баз данных структурированных специализированных научных знаний, извлеченных из исследовательских публикаций.
1
Простой совместный подход к распознаванию именованных сущностей и извлечению отношений позволяет большим языковым моделям извлекать структурированные научные знания.
2
Дообученные модели GPT-3 и Llama-2 успешно извлекают сложные записи по химии материалов из научных текстов.
3
Знания можно извлекать из отдельных предложений или целых абзацев и представлять в виде английских предложений либо структурированных JSON-объектов.
4
Подход обрабатывает связывание легирующих добавок с материалами-матрицами, каталогизацию металл-органических каркасов, а также извлечение сведений о составе, фазе, морфологии и применении.
5
Метод обеспечивает доступный и гибкий способ создания крупных баз специализированных научных знаний из исследовательских публикаций.

Предобученные крупные языковые модели, дообученные для совместного распознавания именованных сущностей и извлечения отношений из научного текста

совместное извлечение именованных сущностей и отношений для получения сложной информации по химии материалов из научных текстов с использованием дообученных больших языковых моделей

Publication Details
Publication Date
2024-02-15
Journal
Publisher
ISSN
Cited by
706
Access Type
Author Information
Authors
Kristin A. Persson
Gerbrand Ceder
John Dagdelen
Anubhav Jain
Nicholas Walker
Sang‐Hoon Lee
Alexander Dunn
Andrew Rosen
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%