Языковая модель ДНК GROVER изучает контекст последовательности в геноме человека

DNA language model GROVER learns sequence context in the human genome
Pierre M. Joubert, Melissa Sanabria, Anna R. Poetsch, Jonas Hirsch
2024-07-23

ДНК-языковая модель GROVERкодирование пар байтовконтекст последовательности человеческого геномапредсказание следующего k-мерасвязывание белка с ДНК
Модели глубокого обучения, формирующие представление о языке на основе ДНК, демонстрируют высокую эффективность в биологических задачах, связанных с геномом. Геномные последовательности подчиняются правилам, сходным с правилами естественного языка, но отличаются отсутствием понятия слов. Мы применили кодирование пар байтов к геному человека и обучили фундаментальную языковую модель GROVER (Genome Rules Obtained Via Extracted Representations — «правила генома, полученные посредством извлечённых представлений»), словарь которой был выбран с помощью специально разработанной задачи предсказания следующего k-мера. Определённый словарь токенов генома человека наилучшим образом отражает информационное содержание, используемое GROVER. Анализ выученных представлений показал, что обученные эмбеддинги токенов преимущественно кодируют информацию, связанную с частотой, содержанием последовательности и длиной. Некоторые токены преимущественно локализованы в повторяющихся областях, тогда как большинство широко распределено по всему геному. GROVER также обучается учитывать контекст и лексическую неоднозначность. Усреднённые обученные эмбеддинги геномных областей связаны с аннотациями функциональной геномики, что указывает на обучение модели этим структурам исключительно на основе контекстных взаимосвязей между токенами. Это демонстрирует объём информации, закодированной в последовательности и доступной для извлечения с помощью GROVER. В задачах дообучения, связанных с биологией генома, включая идентификацию геномных элементов и связывание белков с ДНК, GROVER превосходит другие модели. GROVER осваивает контекст последовательности, представление о структуре и языковые правила. Извлечение этих знаний может быть использовано для составления грамматики кода жизни.
1
После дообучения GROVER превосходит другие модели в задачах идентификации геномных элементов и связывания белков с ДНК, демонстрируя усвоение структуры последовательностей и языковых правил.
2
Усреднённые эмбеддинги геномных регионов связаны с аннотациями функциональной геномики, что указывает на обучение функциональной структуре только через контекстные связи токенов.
3
GROVER представляет собой языковую модель человеческого генома, обученную с использованием byte-pair encoding и специальной задачи предсказания следующего k-мера для выбора словаря.
4
GROVER обучается геномному контексту и лексической неоднозначности; некоторые токены в основном локализованы в повторах, тогда как большинство широко распределено по геному.
5
Выбранный словарь геномных токенов эффективно отражает информационное содержание, а их эмбеддинги преимущественно кодируют частоту, последовательностный состав и длину токенов.

последовательности ДНК генома человека

контекст последовательностей, языкоподобные правила и закодированная геномная информация, извлекаемые из токенных представлений, включая их значение для идентификации геномных элементов и связывания белков с ДНК

Publication Details
Publication Date
2024-07-23
Journal
Publisher
ISSN
Cited by
101
Access Type
Author Information
Authors
Pierre M. Joubert
Melissa Sanabria
Anna R. Poetsch
Jonas Hirsch
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%