Моделирование аспектов языка жизни посредством трансферного обучения на белковых последовательностях
Modeling aspects of the language of life through transfer-learning protein sequences
2019-12-01
SCID: 54.1/2dgxvub4
Discuss with AI
языковая модель ELMoSeqVecпредсказание вторичной структуры белкаэмбеддинги белковых последовательностейсубклеточная локализация
Figures from the paper
Abstract (AI)
ВВЕДЕНИЕ: Предсказание функции и структуры белка по его последовательности является одной из важных задач вычислительной биологии. На протяжении 26 лет большинство наиболее современных подходов объединяли машинное обучение и эволюционную информацию. Однако в некоторых приложениях поиск родственных белков становится слишком трудоемким по времени. Кроме того, эволюционная информация менее эффективна для небольших семейств, например для белков из «темного протеома». Обе эти проблемы решаются с помощью представленной здесь новой методологии. РЕЗУЛЬТАТЫ: Мы предложили новый способ представления белковых последовательностей в виде непрерывных векторов (эмбеддингов), используя языковую модель ELMo, заимствованную из обработки естественного языка. Моделируя белковые последовательности, ELMo эффективно уловила биофизические свойства языка жизни на основе неразмеченных больших данных (UniRef50). Эти новые эмбеддинги мы называем SeqVec (Sequence-to-Vector, «из последовательности в вектор») и демонстрируем их эффективность, обучая простые нейронные сети для решения двух различных задач. На уровне отдельных остатков вторичная структура (Q3 = 79% ± 1, Q8 = 68% ± 1) и области с внутренней неупорядоченностью (MCC = 0.59 ± 0.03) предсказывались значительно лучше, чем при использовании one-hot-кодирования или подходов типа Word2vec. На уровне целого белка субклеточная локализация предсказывалась для десяти классов (Q10 = 68% ± 1), а мембранные белки отличались от водорастворимых белков (Q2 = 87% ± 1). Хотя эмбеддинги SeqVec обеспечивали наилучшие предсказания по одиночным последовательностям, ни одно решение не превзошло лучший существующий метод, использующий эволюционную информацию. Тем не менее наш подход превосходил некоторые популярные методы, использующие эволюционную информацию, а для некоторых белков даже оказывался лучше лучшего из них. Таким образом, эти результаты подтверждают способность эмбеддингов конденсировать базовые принципы белковых последовательностей. В целом основным новшеством является скорость: если сверхбыстрому HHblits требовалось в среднем около двух минут для получения эволюционной информации о целевом белке, то SeqVec создавал эмбеддинги в среднем за 0.03 с...
Key Findings
1
SeqVec обеспечил лучшие предсказания на основе отдельных последовательностей, но в целом не превзошёл лучшие методы, использующие эволюционную информацию.
2
SeqVec создавал эмбеддинги белков в среднем примерно за 0,03 секунды, тогда как HHblits требовал около двух минут для поиска эволюционной информации.
3
SeqVec представляет белковые последовательности в виде непрерывных эмбеддингов с использованием языковой модели ELMo, обученной на немеченых данных UniRef50.
4
SeqVec значительно превзошёл one-hot-кодирование и подходы типа Word2vec при предсказании вторичной структуры и участков внутренней неупорядоченности.
5
С помощью простых нейронных сетей SeqVec предсказывал локализацию в десяти классах с Q10 = 68% ± 1 и различал мембранные и растворимые белки с Q2 = 87% ± 1.
Research Object
белковые последовательности и соответствующие им белки
Research Subject
биофизические свойства, закодированные в белковых последовательностях, и содержащаяся в них предсказательная информация о вторичной структуре, внутренней неупорядоченности и субклеточной локализации
Publication Details
Publication Date
2019-12-01
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest