GENA-LM: семейство открытых фундаментальных языковых моделей ДНК для длинных последовательностей
GENA-LM: a family of open-source foundational DNA language models for long sequences
2024-12-26
SCID: 54.1/jwvgvccw
Discuss with AI
языковые модели ДНКGENA-LMанализ геномных последовательностеймеханизм рекуррентной памятимодели на основе трансформеров
Figures from the paper
Abstract (AI)
Недавние достижения в геномике, обусловленные развитием искусственного интеллекта, открыли беспрецедентные возможности для интерпретации геномных последовательностей, уменьшая необходимость во всеобъемлющем экспериментальном анализе сложных взаимосвязанных молекулярных процессов, лежащих в основе функционирования ДНК. Однако значительная проблема заключается в точной расшифровке геномных последовательностей, что требует понимания богатой контекстной информации, распределённой на протяжении тысяч нуклеотидов. Для решения этой задачи мы представляем языковую модель GENA (GENA-LM) — набор фундаментальных языковых моделей ДНК на основе трансформеров, способных обрабатывать входные последовательности длиной до 36 000 пар оснований. В частности, интеграция недавно разработанного механизма рекуррентной памяти позволяет этим моделям обрабатывать ещё более крупные фрагменты ДНК. Мы предоставляем предобученные версии GENA-LM, включая мультивидовые и таксон-специфичные модели, демонстрируя их способность к дообучению и решению широкого спектра сложных биологических задач при умеренных вычислительных затратах. Хотя языковые модели уже привели к значительным прорывам в биологии белков, GENA-LM демонстрирует столь же многообещающий потенциал для преобразования геномики и анализа мультиомных данных. Все модели находятся в открытом доступе на GitHub (https://github.com/AIRI-Institute/GENA_LM) и HuggingFace (https://huggingface.co/AIRI-Institute). Кроме того, мы предоставляем веб-сервис (https://dnalm.airi.net/), позволяющий удобно аннотировать ДНК с помощью моделей GENA-LM.
Key Findings
1
Механизм рекуррентной памяти позволяет моделям GENA-LM обрабатывать фрагменты ДНК, превышающие стандартный предел длины входа.
2
GENA-LM представляет собой набор открытых трансформерных фундаментальных языковых моделей ДНК, поддерживающих последовательности длиной до 36 000 пар оснований.
3
Модели GENA-LM способны решать задачи геномного и мультиомного анализа при умеренных вычислительных затратах.
4
Предобученные модели, исходный код и веб-сервис аннотации ДНК доступны через GitHub, Hugging Face и dnalm.airi.net.
5
Набор включает предобученные мультивидовые и таксономически специфичные модели для дообучения на разнообразных сложных биологических задачах.
Research Object
Семейство языковых моделей для ДНК GENA-LM на базе трансформеров для длинных геномных последовательностей (до 36 000 нуклеотидов), включая мультиивидовые и таксон-специфичные варианты
Research Subject
способность к контекстному представлению и моделированию последовательностей длиной до 36 000 пар оснований, включая масштабирование на более крупные сегменты ДНК и переносимость на биологические задачи
Publication Details
Publication Date
2024-12-26
Journal
Publisher
ISSN
Cited by
82
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai5
DNABERT: предварительно обученная двунаправленная модель представлений энкодера на основе Transformers для языка ДНК в геноме2021
Longformer: трансформер для длинных документов2020
ETC: Кодирование длинных и структурированных входных данных в трансформерах2020
Transformer-XL: внимательные языковые модели за пределами контекста фиксированной длины2019
Труды 24-й Международной конференции по машинному обучению2007