GENA-LM: семейство фундаментальных языковых моделей ДНК с открытым исходным кодом для длинных последовательностей

GENA-LM: A Family of Open-Source Foundational DNA Language Models for Long Sequences
Veniamin Fishman, Yuri Kuratov, Aleksei Shmelev, Maxim Petrov, Dmitry Penzar, Denis Shepelin, Nikolay Chekanov, Olga Kardymon, Mikhail Burtsev
2023-06-13

языковые модели ДНКGENA-LMрекуррентная памятьгеномикамоделирование длинных последовательностей
Недавние достижения в геномике, обусловленные развитием искусственного интеллекта, открыли беспрецедентные возможности для интерпретации геномных последовательностей, снижая необходимость во всестороннем экспериментальном анализе сложных взаимосвязанных молекулярных процессов, лежащих в основе функционирования ДНК. Однако значительная проблема заключается в точной расшифровке геномных последовательностей, которая требует понимания богатой контекстной информации, распределённой на протяжении тысяч нуклеотидов. Для решения этой задачи мы представляем GENA-LM — набор фундаментальных языковых моделей ДНК на основе архитектуры трансформера, способных обрабатывать входные последовательности длиной до 36 000 пар оснований. В частности, интеграция недавно разработанного механизма рекуррентной памяти позволяет этим моделям обрабатывать ещё более крупные фрагменты ДНК. Мы предоставляем предварительно обученные версии GENA-LM и демонстрируем их способность к дообучению для решения широкого спектра сложных биологических задач при умеренных вычислительных затратах. Хотя языковые модели уже привели к значительным прорывам в биологии белков, GENA-LM демонстрирует столь же многообещающий потенциал для преобразования геномики и анализа мультиомных данных. Все модели находятся в открытом доступе на GitHub: https://github.com/AIRI-Institute/GENA-LM и Hugging Face: https://huggingface.co/AIRI-Institute.
1
Новый механизм Recurrent Memory позволяет моделям GENA-LM обрабатывать сегменты ДНК, превышающие стандартный предел длины входа.
2
GENA-LM — это семейство трансформерных фундаментальных языковых моделей ДНК, поддерживающих входные последовательности длиной до 36 000 пар оснований.
3
Модели GENA-LM и их предварительно обученные версии опубликованы в открытом доступе на GitHub и Hugging Face.
4
Модели демонстрируют перспективность для анализа геномных и мультиомных данных благодаря учёту дальнего контекста в последовательностях ДНК.
5
Предварительно обученные модели можно дообучать для решения разнообразных сложных биологических задач при умеренных вычислительных требованиях.

длинные геномные последовательности ДНК

контекстное моделирование последовательностей и эффективность выполнения последующих биологических задач для последовательностей длиной до 36 000 пар оснований и более

Publication Details
Publication Date
2023-06-13
Journal
Publisher
ISSN
Cited by
56
Access Type
Author Information
Authors
Veniamin Fishman
Yuri Kuratov
Aleksei Shmelev
Maxim Petrov
Dmitry Penzar
Denis Shepelin
Nikolay Chekanov
Olga Kardymon
Mikhail Burtsev
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%