DNABERT: предварительно обученная двунаправленная модель представлений энкодера на основе Transformers для языка ДНК в геноме
DNABERT: pre-trained Bidirectional Encoder Representations from Transformers model for DNA-language in genome
2021-02-03
SCID: 54.1/tphf47m3
Discuss with AI
языковая модель ДНКDNABERTгеномные последовательности ДНКпредсказание регуляторных элементовсайты связывания транскрипционных факторов
Figures from the paper
Abstract (AI)
АКТУАЛЬНОСТЬ: Расшифровка языка некодирующей ДНК является одной из фундаментальных задач геномных исследований. Регуляторный код генов чрезвычайно сложен вследствие полисемии и существования отдалённых семантических связей, которые предыдущие вычислительные методы часто не способны выявить, особенно в условиях ограниченного объёма данных. РЕЗУЛЬТАТЫ: Для решения этой задачи мы разработали новую предварительно обученную модель двунаправленного представления энкодера под названием DNABERT, предназначенную для формирования глобального и переносимого понимания геномных последовательностей ДНК на основе контекстов нуклеотидов, расположенных выше и ниже по последовательности. Мы сравнили DNABERT с наиболее широко используемыми программами для полногеномного предсказания регуляторных элементов и продемонстрировали простоту его использования, точность и эффективность. Мы показываем, что одна предварительно обученная модель Transformer может одновременно достигать передовых результатов при предсказании промоторов, сайтов сплайсинга и сайтов связывания факторов транскрипции после простой донастройки на небольших наборах размеченных данных, специфичных для конкретной задачи. Кроме того, DNABERT обеспечивает непосредственную визуализацию важности нуклеотидов и семантических связей внутри входных последовательностей, что повышает интерпретируемость и позволяет точно выявлять консервативные мотивы последовательностей и кандидатов на функциональные генетические варианты. Наконец, мы демонстрируем, что DNABERT, предварительно обученная на геноме человека, может легко применяться к другим организмам, обеспечивая исключительно высокую эффективность. Мы предполагаем, что предварительно обученная модель DNABERT может быть донастроена для решения многих других задач анализа последовательностей. ДОСТУПНОСТЬ И РЕАЛИЗАЦИЯ: Исходный код, а также предварительно обученная и донастроенная модели DNABERT доступны на GitHub (https://github.com/jerryji1993/DNABERT). ДОПОЛНИТЕЛЬНАЯ ИНФОРМАЦИЯ: Дополнительные данные доступны онлайн в журнале Bioinformatics.
Key Findings
1
Модель DNABERT, предварительно обученная на геноме человека, легко переносится на другие организмы, сохраняя исключительно высокую эффективность.
2
Одна предварительно обученная модель DNABERT достигает передового уровня качества при предсказании промоторов, сайтов сплайсинга и сайтов связывания транскрипционных факторов после дообучения на небольших размеченных наборах данных.
3
По сравнению с широко используемыми программами для предсказания регуляторных элементов генома DNABERT обеспечивает более удобное использование, высокую точность и эффективность.
4
DNABERT представляет собой двунаправленную Transformer-модель, предварительно обученную на контекстах геномной ДНК для получения глобальных переносимых представлений нуклеотидных последовательностей.
5
DNABERT позволяет визуализировать важность отдельных нуклеотидов и семантические связи в последовательностях, облегчая интерпретируемое обнаружение мотивов и выявление кандидатов на функциональные генетические варианты.
Research Object
DNABERT — предварительно обученная модель Bidirectional Encoder Representations from Transformers (BERT), применяемая к последовательностям ДНК/геному
Research Subject
представления последовательностей с учетом контекста и эффективность предсказания регуляторных функций, включая промоторы, сайты сплайсинга, сайты связывания транскрипционных факторов, консервативные мотивы и функциональные генетические варианты
Publication Details
Publication Date
2021-02-03
Journal
Publisher
ISSN
Cited by
1345
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai2
Работы, цитирующие эту статью6
Язык белков: обработка естественного языка, машинное обучение и белковые последовательности2021
Языковые модели ДНК являются мощными предикторами эффектов вариантов по всему геному2023
Языковая модель ДНК GROVER изучает контекст последовательности в геноме человека2024
GENA-LM: семейство открытых фундаментальных языковых моделей ДНК для длинных последовательностей2024
Видоспецифичные языковые модели ДНК выявляют регуляторные элементы и их эволюцию2024
Межвидовое моделирование геномов растений на уровне отдельных нуклеотидов с использованием предварительно обученной языковой модели ДНК2025