Видоспецифичные языковые модели ДНК выявляют регуляторные элементы и их эволюцию

Species-aware DNA language models capture regulatory elements and their evolution
Julien Gagneur, Alexander Karollus, Johannes Hingerl, Dennis Gankin, Martin Grosshauser, Kristian Klemon
2024-04-02

предсказание экспрессии генов на основе MPRAэволюционная консервациярегуляторные элементывидоспецифичные языковые модели ДНКмотивы факторов транскрипции
Предпосылки: Развитие крупномасштабных проектов по секвенированию геномов множества видов открывает новые возможности для понимания того, как геномы кодируют инструкции регуляции генов. Для этого необходимы новые алгоритмы, способные использовать консервативность для выявления регуляторных элементов с учетом их эволюции. Результаты: Здесь мы представляем видоспецифичные языковые модели ДНК, обученные на данных более чем 800 видов, охватывающих свыше 500 миллионов лет эволюции. Исследуя их способность предсказывать замаскированные нуклеотиды по контексту, мы показываем, что языковые модели ДНК отличают мотивы факторов транскрипции и РНК-связывающих белков от фоновой некодирующей последовательности. Благодаря своей гибкости языковые модели ДНК выявляют консервативные регуляторные элементы на значительно больших эволюционных расстояниях, чем это позволяет выравнивание последовательностей. Примечательно, что языковые модели ДНК лучше реконструируют in vivo связанные с мишенью экземпляры мотивов, чем несвязанные, а также учитывают эволюцию последовательностей мотивов и их позиционные ограничения, демонстрируя, что эти модели улавливают функциональный контекст последовательностей высокого порядка и эволюционный контекст. Кроме того, мы показываем, что видоспецифичное обучение обеспечивает улучшенные представления последовательностей для прогнозирования экспрессии генов на основе эндогенных данных и MPRA, а также для поиска мотивов. Выводы: В совокупности эти результаты демонстрируют, что видоспецифичные языковые модели ДНК представляют собой мощный, гибкий и масштабируемый инструмент для интеграции информации из крупных коллекций сильно дивергировавших геномов.
1
Модели языка ДНК с учётом видов были обучены на данных более чем 800 видов, охватывающих свыше 500 миллионов лет эволюции.
2
Обучение с учётом видов улучшает представления последовательностей для предсказания экспрессии генов по эндогенным данным и данным MPRA, а также для поиска мотивов.
3
При предсказании замаскированных нуклеотидов модели различают мотивы факторов транскрипции и РНК-связывающих белков на фоне некодирующих последовательностей.
4
Модели лучше реконструируют мотивы, связанные с белками in vivo, чем несвязанные мотивы, и учитывают эволюцию последовательностей мотивов и их позиционные ограничения.
5
В отличие от выравнивания последовательностей, модели выявляют консервативные регуляторные элементы на значительно больших эволюционных расстояниях.

мультивидовые геномные последовательности ДНК, включая консервативные и эволюционирующие некодирующие регуляторные области более чем у 800 видов

способность видоспецифичных языковых моделей ДНК выявлять мотивы факторов транскрипции и РНК-связывающих белков, их функциональный статус связывания, позиционные ограничения и эволюционную консервацию

Publication Details
Publication Date
2024-04-02
Journal
Publisher
ISSN
Cited by
54
Access Type
Author Information
Authors
Julien Gagneur
Alexander Karollus
Johannes Hingerl
Dennis Gankin
Martin Grosshauser
Kristian Klemon
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%