GENA-LM: семейство открытых фундаментальных языковых моделей ДНК для длинных последовательностей

GENA-LM: a family of open-source foundational DNA language models for long sequences
Veniamin Fishman, Yuri Kuratov, Aleksei Shmelev, Maxim Petrov, Dmitry Penzar, Denis Shepelin, Nikolay Chekanov, Olga Kardymon, Mikhail Burtsev
2024-12-26

языковые модели ДНКGENA-LMанализ геномных последовательностеймеханизм рекуррентной памятимодели на основе трансформеров
Недавние достижения в геномике, обусловленные развитием искусственного интеллекта, открыли беспрецедентные возможности для интерпретации геномных последовательностей, уменьшая необходимость во всеобъемлющем экспериментальном анализе сложных взаимосвязанных молекулярных процессов, лежащих в основе функционирования ДНК. Однако значительная проблема заключается в точной расшифровке геномных последовательностей, что требует понимания богатой контекстной информации, распределённой на протяжении тысяч нуклеотидов. Для решения этой задачи мы представляем языковую модель GENA (GENA-LM) — набор фундаментальных языковых моделей ДНК на основе трансформеров, способных обрабатывать входные последовательности длиной до 36 000 пар оснований. В частности, интеграция недавно разработанного механизма рекуррентной памяти позволяет этим моделям обрабатывать ещё более крупные фрагменты ДНК. Мы предоставляем предобученные версии GENA-LM, включая мультивидовые и таксон-специфичные модели, демонстрируя их способность к дообучению и решению широкого спектра сложных биологических задач при умеренных вычислительных затратах. Хотя языковые модели уже привели к значительным прорывам в биологии белков, GENA-LM демонстрирует столь же многообещающий потенциал для преобразования геномики и анализа мультиомных данных. Все модели находятся в открытом доступе на GitHub (https://github.com/AIRI-Institute/GENA_LM) и HuggingFace (https://huggingface.co/AIRI-Institute). Кроме того, мы предоставляем веб-сервис (https://dnalm.airi.net/), позволяющий удобно аннотировать ДНК с помощью моделей GENA-LM.
1
Механизм рекуррентной памяти позволяет моделям GENA-LM обрабатывать фрагменты ДНК, превышающие стандартный предел длины входа.
2
GENA-LM представляет собой набор открытых трансформерных фундаментальных языковых моделей ДНК, поддерживающих последовательности длиной до 36 000 пар оснований.
3
Модели GENA-LM способны решать задачи геномного и мультиомного анализа при умеренных вычислительных затратах.
4
Предобученные модели, исходный код и веб-сервис аннотации ДНК доступны через GitHub, Hugging Face и dnalm.airi.net.
5
Набор включает предобученные мультивидовые и таксономически специфичные модели для дообучения на разнообразных сложных биологических задачах.

Семейство языковых моделей для ДНК GENA-LM на базе трансформеров для длинных геномных последовательностей (до 36 000 нуклеотидов), включая мультиивидовые и таксон-специфичные варианты

способность к контекстному представлению и моделированию последовательностей длиной до 36 000 пар оснований, включая масштабирование на более крупные сегменты ДНК и переносимость на биологические задачи

Publication Details
Publication Date
2024-12-26
Journal
Publisher
ISSN
Cited by
82
Access Type
Author Information
Authors
Veniamin Fishman
Yuri Kuratov
Aleksei Shmelev
Maxim Petrov
Dmitry Penzar
Denis Shepelin
Nikolay Chekanov
Olga Kardymon
Mikhail Burtsev
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%