Развитие биоинформатики с помощью языковых моделей: компоненты, применения и перспективы

Advancing bioinformatics with language models: components, applications, and perspectives
Jiajia Liu, Mengyuan Yang, Yankai Yu, Haixia Xu, Tiangang Wang, Kang Li, Xiaobo Zhou
2026-07-01

биоинформатикафундаментальные моделибольшие языковые моделиодноклеточный анализтрансформерные модели
Большие языковые модели (LLM) представляют собой класс моделей искусственного интеллекта, основанных на глубоком обучении, которые демонстрируют высокую эффективность в решении различных задач, особенно в области обработки естественного языка (NLP). Большие языковые модели обычно состоят из искусственных нейронных сетей с многочисленными параметрами, обучаемых на больших объемах неразмеченных данных с использованием самообучения или полуобучения. Однако их потенциал для решения задач биоинформатики может превосходить их возможности в моделировании человеческого языка. В этом обзоре представлен всесторонний обзор ключевых компонентов больших языковых моделей (LLM) в биоинформатике, включая геномику, транскриптомику, протеомику, разработку лекарственных средств и одноклеточный анализ. Рассмотрены методы токенизации различных типов данных, архитектура трансформерных моделей, основной механизм внимания и процессы предварительного обучения, лежащие в основе этих моделей. Кроме того, представлены доступные в настоящее время базовые модели и освещены их последующие применения в различных областях биоинформатики. Наконец, опираясь на собственный опыт, мы предлагаем практические рекомендации пользователям и разработчикам LLM, уделяя особое внимание стратегиям оптимизации их использования и содействия дальнейшим инновациям в этой области.
1
Применения LLM в биоинформатике рассматриваются для геномики, транскриптомики, протеомики, разработки лекарств и анализа одиночных клеток.
2
Большие языковые модели могут обладать значительным потенциалом для биоинформатики, выходящим за пределы их доказанной эффективности в моделировании человеческого языка.
3
Предлагаются практические рекомендации для пользователей и разработчиков LLM по оптимизации их применения и содействию дальнейшим инновациям в биоинформатике.
4
В обзоре систематизированы доступные фундаментальные модели и обобщены их последующие применения в различных областях биоинформатики.
5
В обзоре рассматриваются ключевые компоненты биоинформатических LLM, включая токенизацию, архитектуры трансформеров, механизмы внимания и процессы предварительного обучения.

большие языковые модели, применяемые к биоинформатическим данным и задачам в области геномики, транскриптомики, протеомики, разработки лекарственных препаратов и одноклеточного анализа

компоненты, архитектуры, процессы предварительного обучения и последующие применения больших языковых моделей в биоинформатике

Publication Details
Publication Date
2026-07-01
Journal
Publisher
ISSN
Cited by
1
Access Type
Author Information
Authors
Jiajia Liu
Mengyuan Yang
Yankai Yu
Haixia Xu
Tiangang Wang
Kang Li
Xiaobo Zhou
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%