Биологическая структура и функции возникают при масштабировании обучения без учителя до 250 миллионов белковых последовательностей

Biological structure and function emerge from scaling unsupervised learning to 250 million protein sequences
C. Lawrence Zitnick, Siddharth Goyal, Rob Fergus, Zeming Lin, Tom Sercu, Alexander Rives, Myle Ott, Jason Liu, Joshua Meier, Demi Guo, Jerry Ma
2019-04-29

предсказание эффекта мутацийязыковое моделирование белковпредставления белковых последовательностейотдалённая гомологияобучение без учителя
В области искусственного интеллекта сочетание масштабов данных и емкости моделей, обеспечиваемое обучением без учителя, привело к значительному прогрессу в обучении представлений и статистической генерации. В науках о жизни ожидаемый рост объемов секвенирования открывает беспрецедентные возможности для получения данных о естественном разнообразии последовательностей. Моделирование белкового языка в масштабе эволюции представляет собой логичный шаг на пути к прогностическому и генеративному искусственному интеллекту для биологии. С этой целью мы использовали обучение без учителя для тренировки глубокой контекстной языковой модели на 86 миллиардах аминокислот, содержащихся в 250 миллионах белковых последовательностей, охватывающих эволюционное разнообразие. Полученная модель содержит в своих представлениях информацию о биологических свойствах. Представления обучаются исключительно на данных о последовательностях. Освоенное пространство представлений обладает многомасштабной организацией, отражающей структуру на уровнях от биохимических свойств аминокислот до отдаленной гомологии белков. Информация о вторичной и третичной структуре закодирована в представлениях и может быть выявлена с помощью линейных проекций. Обучение представлений формирует признаки, обобщаемые в широком спектре приложений, обеспечивая передовое по современным меркам обучение с учителем для предсказания эффектов мутаций и вторичной структуры, а также улучшая современные признаки для предсказания дальних контактов.
1
Без учителя обучена контекстная языковая модель белков на 86 миллиардах аминокислот из 250 миллионов эволюционно разнообразных белковых последовательностей.
2
Информация о вторичной и третичной структуре белков содержится в выученных представлениях и может извлекаться с помощью линейных проекций.
3
Представления, полученные только из последовательностей, кодируют биологическую информацию на разных масштабах — от биохимических свойств аминокислот до удалённой гомологии белков.
4
Выученные признаки обеспечивают современные результаты в обучаемом с учителем предсказании эффектов мутаций и вторичной структуры.
5
Эти представления улучшают современные признаки для предсказания дальних контактов между остатками белка.

250 миллионов эволюционно разнообразных белковых последовательностей и полученные на их основе представления белковой языковой модели

Возникновение и кодирование многоштабной биологической структуры и функций, включая биохимические свойства, удалённую гомологию, структуру белков, эффекты мутаций и дальние контакты

Publication Details
Publication Date
2019-04-29
Journal
Publisher
ISSN
Access Type
Author Information
Authors
C. Lawrence Zitnick
Siddharth Goyal
Rob Fergus
Zeming Lin
Tom Sercu
Alexander Rives
Myle Ott
Jason Liu
Joshua Meier
Demi Guo
Jerry Ma
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%