Методы машинного обучения для решения задач, связанных с малыми объемами данных в молекулярной науке
Machine Learning Methods for Small Data Challenges in Molecular Science
2023-06-29
SCID: 54.1/udfr7dms
Discuss with AI
расширение данныхглубокое обучениемашинное обучениемолекулярная наукапроблемы малых данных
Figures from the paper
Abstract (AI)
Малые объемы данных часто используются в научных и инженерных исследованиях вследствие различных ограничений, включая временные и финансовые затраты, этические соображения, требования к конфиденциальности и безопасности, а также технические ограничения при получении данных. Однако в течение последнего десятилетия основное внимание уделялось большим данным, тогда как малые объемы данных и связанные с ними проблемы получали мало внимания, несмотря на то что в исследованиях машинного обучения (ML) и глубокого обучения (DL) эти проблемы имеют более серьезный технический характер. В целом проблемы, связанные с малыми объемами данных, часто усугубляются такими факторами, как разнообразие данных, импутация, шум, дисбаланс и высокая размерность. К счастью, современная эпоха больших данных характеризуется технологическими прорывами в области машинного обучения, глубокого обучения и искусственного интеллекта (AI), которые обеспечивают проведение научных исследований на основе данных; кроме того, многие передовые технологии ML и DL, разработанные для работы с большими данными, непреднамеренно предложили решения для проблем, связанных с малыми объемами данных. В результате за последнее десятилетие был достигнут значительный прогресс в применении ML и DL к задачам, связанным с малыми объемами данных. В этом обзоре обобщаются и анализируются несколько новых потенциальных решений таких задач в молекулярной науке, включая химические и биологические науки. Рассматриваются как базовые алгоритмы машинного обучения, такие как линейная регрессия, логистическая регрессия (LR), метод k ближайших соседей (KNN), метод опорных векторов (SVM), ядерное обучение (KL), случайный лес (RF) и деревья градиентного бустинга (GBT), так и более сложные методы, включая искусственные нейронные сети (ANN), сверточные нейронные сети (CNN), U-Net, графовые нейронные сети (GNN), генеративно-состязательные сети (GAN), сети с долгой краткосрочной памятью (LSTM), автокодировщики, трансформеры, перенос обучения, активное обучение, графовое полуобучение, сочетание глубокого обучения с традиционным машинным обучением и дополнение данных на основе физических моделей. Также кратко обсуждаются последние достижения в этих методах. В заключение обзора рассматриваются перспективные направления решения задач, связанных с малыми объемами данных, в молекулярной науке.
Key Findings
1
Перспективным направлением для молекулярной науки названа комбинация машинного обучения с предметными знаниями и физическими моделями.
2
Методы, первоначально разработанные для больших данных, обеспечили значительный прогресс в решении задач, связанных с малыми данными.
3
Малые наборы данных создают серьёзные проблемы машинного обучения, включая низкое разнообразие, пропуски, шум, дисбаланс классов и высокую размерность.
4
Ограничения малых данных в молекулярной науке обусловлены временными, финансовыми, этическими, конфиденциальными, защитными и техническими ограничениями сбора данных.
5
В обзоре анализируются классические алгоритмы и современные подходы, включая перенос обучения, активное обучение, полуобучение, генеративные модели и физически обоснованное расширение данных.
Research Object
проблемы малых данных в молекулярной науке, включая химические и биологические науки
Research Subject
решения на основе машинного и глубокого обучения для работы с разнообразием данных, пропусками, шумом, дисбалансом и высокой размерностью в приложениях малых данных молекулярной науки
Publication Details
Publication Date
2023-06-29
Journal
Publisher
ISSN
Cited by
497
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai17
Высокоточное предсказание структуры белков с помощью AlphaFold2021
Greedy function approximation: A gradient boosting machine.2001
Обнаружение уязвимостей, специфичных для функциональности, путем поиска индивидуальных эквивалентных по функциональности API в открытых репозиториях2025
Всеобъемлющий обзор графовых нейронных сетей2020
Машинное обучение: тенденции, перспективы и прогнозы2015
Модель графовой нейронной сети2008
Transformers: современное состояние обработки естественного языка2020
Обучение представлений без учителя с помощью глубоких сверточных генеративных состязательных сетей2015
Динамическая графовая сверточная нейронная сеть для обучения на облаках точек2019
Перенос стиля изображения с использованием сверточных нейронных сетей2016
Обзор рекуррентных нейронных сетей: LSTM‑ячейки и архитектуры сетей2019
Сверточные нейронные сети: обзор и применение в радиологии2018
Генеративные состязательные сети: обзор2018
Предварительное обучение, промптинг и предсказание: систематический обзор методов промптинга в обработке естественного языка2022
Графовые сверточные нейронные сети для рекомендательных систем веб‑масштаба2018
Методы машинного обучения и интеллектуального анализа данных в исследовании сахарного диабета2017
Графовые нейронные сети в рекомендательных системах: обзор2022