Язык белков: обработка естественного языка, машинное обучение и белковые последовательности
The language of proteins: NLP, machine learning & protein sequences
2021-01-01
SCID: 54.1/b4p3ybng
Discuss with AI
контекстуализированные эмбеддингимаскированное языковое моделированиеобработка естественного языкабелковые последовательностисамообучение
Figures from the paper
Abstract (AI)
Обработка естественного языка (NLP) — это область информатики, занимающаяся автоматизированным анализом текстов и языка. В последние годы, после серии прорывов в области глубокого обучения и машинного обучения, методы NLP продемонстрировали значительный прогресс. В этой статье мы рассматриваем успехи, перспективы и ограничения применения алгоритмов NLP для изучения белков. Белки, которые можно представить в виде строк из букв аминокислот, естественным образом подходят для многих методов NLP. Мы исследуем концептуальные сходства и различия между белками и языком, а также рассматриваем широкий спектр задач, связанных с белками, для которых применимо машинное обучение. Мы представляем методы кодирования информации о белках в виде текста и её анализа с помощью методов NLP, рассматривая как классические концепции, такие как мешок слов, k-меры/n-граммы и текстовый поиск, так и современные методы, включая векторные представления слов, контекстуализированные векторные представления, глубокое обучение и нейросетевые языковые модели. Особое внимание уделено последним инновациям, таким как моделирование языка с маскированием, самообучение без учителя и модели на основе механизма внимания. В заключение мы обсуждаем тенденции и проблемы на стыке NLP и исследований белков.
Key Findings
1
Применение NLP к белкам обладает значительным потенциалом, но сопровождается методологическими недостатками и нерешёнными проблемами на стыке NLP и исследований белков.
2
Аминокислотные последовательности белков можно представлять как текст, что делает их естественно подходящими для многих методов обработки естественного языка.
3
Для анализа белков применимы методы от мешка слов, k-меров или n-грамм и текстового поиска до векторных представлений слов, контекстуализированных представлений, глубокого обучения и нейронных языковых моделей.
4
К последним инновациям в моделировании белков относятся маскированное языковое моделирование, самоконтролируемое обучение и архитектуры на основе внимания.
5
Обзор сопоставляет белки и человеческий язык, выявляя как концептуальные сходства, так и существенные различия, важные для вычислительного моделирования.
Research Object
белковые последовательности, представленные в виде строк из букв аминокислот
Research Subject
применимость, возможности и ограничения методов NLP и машинного обучения для анализа белковых последовательностей и задач, связанных с белками
Publication Details
Publication Date
2021-01-01
Journal
Publisher
ISSN
Cited by
392
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai4
Использование генеративного искусственного интеллекта для масштабирования интеллектуальных обучающих систем2023
DNABERT: предварительно обученная двунаправленная модель представлений энкодера на основе Transformers для языка ДНК в геноме2021
Исследование пределов переносного обучения с унифицированным трансформером «текст-в-текст»2019
Обогащение векторных представлений слов информацией о подсловах2017