DNABERT: предварительно обученная двунаправленная модель представлений энкодера на основе Transformers для языка ДНК в геноме

DNABERT: pre-trained Bidirectional Encoder Representations from Transformers model for DNA-language in genome
Yanrong Ji, Zhihan Zhou, Han Liu, Ramana V. Davuluri
2021-02-03

языковая модель ДНКDNABERTгеномные последовательности ДНКпредсказание регуляторных элементовсайты связывания транскрипционных факторов
АКТУАЛЬНОСТЬ: Расшифровка языка некодирующей ДНК является одной из фундаментальных задач геномных исследований. Регуляторный код генов чрезвычайно сложен вследствие полисемии и существования отдалённых семантических связей, которые предыдущие вычислительные методы часто не способны выявить, особенно в условиях ограниченного объёма данных. РЕЗУЛЬТАТЫ: Для решения этой задачи мы разработали новую предварительно обученную модель двунаправленного представления энкодера под названием DNABERT, предназначенную для формирования глобального и переносимого понимания геномных последовательностей ДНК на основе контекстов нуклеотидов, расположенных выше и ниже по последовательности. Мы сравнили DNABERT с наиболее широко используемыми программами для полногеномного предсказания регуляторных элементов и продемонстрировали простоту его использования, точность и эффективность. Мы показываем, что одна предварительно обученная модель Transformer может одновременно достигать передовых результатов при предсказании промоторов, сайтов сплайсинга и сайтов связывания факторов транскрипции после простой донастройки на небольших наборах размеченных данных, специфичных для конкретной задачи. Кроме того, DNABERT обеспечивает непосредственную визуализацию важности нуклеотидов и семантических связей внутри входных последовательностей, что повышает интерпретируемость и позволяет точно выявлять консервативные мотивы последовательностей и кандидатов на функциональные генетические варианты. Наконец, мы демонстрируем, что DNABERT, предварительно обученная на геноме человека, может легко применяться к другим организмам, обеспечивая исключительно высокую эффективность. Мы предполагаем, что предварительно обученная модель DNABERT может быть донастроена для решения многих других задач анализа последовательностей. ДОСТУПНОСТЬ И РЕАЛИЗАЦИЯ: Исходный код, а также предварительно обученная и донастроенная модели DNABERT доступны на GitHub (https://github.com/jerryji1993/DNABERT). ДОПОЛНИТЕЛЬНАЯ ИНФОРМАЦИЯ: Дополнительные данные доступны онлайн в журнале Bioinformatics.
1
Модель DNABERT, предварительно обученная на геноме человека, легко переносится на другие организмы, сохраняя исключительно высокую эффективность.
2
Одна предварительно обученная модель DNABERT достигает передового уровня качества при предсказании промоторов, сайтов сплайсинга и сайтов связывания транскрипционных факторов после дообучения на небольших размеченных наборах данных.
3
По сравнению с широко используемыми программами для предсказания регуляторных элементов генома DNABERT обеспечивает более удобное использование, высокую точность и эффективность.
4
DNABERT представляет собой двунаправленную Transformer-модель, предварительно обученную на контекстах геномной ДНК для получения глобальных переносимых представлений нуклеотидных последовательностей.
5
DNABERT позволяет визуализировать важность отдельных нуклеотидов и семантические связи в последовательностях, облегчая интерпретируемое обнаружение мотивов и выявление кандидатов на функциональные генетические варианты.

DNABERT — предварительно обученная модель Bidirectional Encoder Representations from Transformers (BERT), применяемая к последовательностям ДНК/геному

представления последовательностей с учетом контекста и эффективность предсказания регуляторных функций, включая промоторы, сайты сплайсинга, сайты связывания транскрипционных факторов, консервативные мотивы и функциональные генетические варианты

Publication Details
Publication Date
2021-02-03
Journal
Publisher
ISSN
Cited by
1345
Access Type
Author Information
Authors
Yanrong Ji
Zhihan Zhou
Han Liu
Ramana V. Davuluri
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%