GENA-LM: семейство фундаментальных языковых моделей ДНК с открытым исходным кодом для длинных последовательностей
GENA-LM: A Family of Open-Source Foundational DNA Language Models for Long Sequences
2023-06-13
SCID: 54.1/jmqnf5pf
Discuss with AI
языковые модели ДНКGENA-LMрекуррентная памятьгеномикамоделирование длинных последовательностей
Figures from the paper
Abstract (AI)
Недавние достижения в геномике, обусловленные развитием искусственного интеллекта, открыли беспрецедентные возможности для интерпретации геномных последовательностей, снижая необходимость во всестороннем экспериментальном анализе сложных взаимосвязанных молекулярных процессов, лежащих в основе функционирования ДНК. Однако значительная проблема заключается в точной расшифровке геномных последовательностей, которая требует понимания богатой контекстной информации, распределённой на протяжении тысяч нуклеотидов. Для решения этой задачи мы представляем GENA-LM — набор фундаментальных языковых моделей ДНК на основе архитектуры трансформера, способных обрабатывать входные последовательности длиной до 36 000 пар оснований. В частности, интеграция недавно разработанного механизма рекуррентной памяти позволяет этим моделям обрабатывать ещё более крупные фрагменты ДНК. Мы предоставляем предварительно обученные версии GENA-LM и демонстрируем их способность к дообучению для решения широкого спектра сложных биологических задач при умеренных вычислительных затратах. Хотя языковые модели уже привели к значительным прорывам в биологии белков, GENA-LM демонстрирует столь же многообещающий потенциал для преобразования геномики и анализа мультиомных данных. Все модели находятся в открытом доступе на GitHub: https://github.com/AIRI-Institute/GENA-LM и Hugging Face: https://huggingface.co/AIRI-Institute.
Key Findings
1
Новый механизм Recurrent Memory позволяет моделям GENA-LM обрабатывать сегменты ДНК, превышающие стандартный предел длины входа.
2
GENA-LM — это семейство трансформерных фундаментальных языковых моделей ДНК, поддерживающих входные последовательности длиной до 36 000 пар оснований.
3
Модели GENA-LM и их предварительно обученные версии опубликованы в открытом доступе на GitHub и Hugging Face.
4
Модели демонстрируют перспективность для анализа геномных и мультиомных данных благодаря учёту дальнего контекста в последовательностях ДНК.
5
Предварительно обученные модели можно дообучать для решения разнообразных сложных биологических задач при умеренных вычислительных требованиях.
Research Object
длинные геномные последовательности ДНК
Research Subject
контекстное моделирование последовательностей и эффективность выполнения последующих биологических задач для последовательностей длиной до 36 000 пар оснований и более
Publication Details
Publication Date
2023-06-13
Journal
Publisher
ISSN
Cited by
56
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest