Исследование факторов, определяющих эффективность машинного обучения при прогнозировании приспособленности белков
Investigating the determinants of performance in machine learning for protein fitness prediction
2025-07-21
SCID: 54.1/g2p7bgm7
Discuss with AI
эпистаз и сложность ландшафталандшафты приспособленностипозиционная экстраполяцияпредсказание приспособленности белковпредсказание зависимости «последовательность–приспособленность»
Figures from the paper
Abstract (AI)
Машинное обучение (МО) произвело революцию в биологии белков, позволив решить давние задачи, связанные со сворачиванием белков, генерацией каркасов и конструированием функций. Различные архитектуры продемонстрировали высокую эффективность в задачах обучения с учителем для прогнозирования приспособленности белков. Однако в отсутствие рациональных подходов к оценке того, какие архитектуры оптимальны для конкретных наборов данных и задач инженерии, выбор архитектуры остается сложным. Здесь мы предлагаем систему для исследования факторов, определяющих успешность различных архитектур МО. Используя смоделированные (модель NK) и эмпирические ландшафты приспособленности, мы оцениваем прогнозирование зависимости «последовательность—приспособленность» по шести ключевым показателям эффективности: интерполяции внутри области обучения, экстраполяции за пределы области обучения, устойчивости к увеличению эпистаза/шероховатости, способности выполнять позиционную экстраполяцию, устойчивости к разреженным обучающим данным и чувствительности к длине последовательности. Мы показываем, что архитектурные различия между алгоритмами стабильно влияют на эффективность по этим показателям как на экспериментальных, так и на теоретических ландшафтах. Кроме того, шероховатость ландшафта оказывается одним из главных факторов, определяющих точность прогнозирования зависимости «последовательность—приспособленность». Наша методология и результаты предлагают рациональную стратегию отбора экспериментальных данных, выбора моделей и их оценки, основанную на теории ландшафтов приспособленности; мы надеемся, что она будет способствовать повышению точности прогнозирования зависимости «последовательность—приспособленность» и окажет влияние на инженерный дизайн белков и прогнозирование функций вариантов.
Key Findings
1
Архитектурные различия стабильно влияют на результаты как на смоделированных ландшафтах NK, так и на эмпирических ландшафтах приспособленности белков.
2
Шероховатость ландшафта приспособленности выявлена как один из основных факторов точности прогнозирования соответствия последовательностей.
3
Производительность оценивается по интерполяции, экстраполяции, устойчивости к эпистазу, позиционной экстраполяции, работе с разреженными данными и чувствительности к длине последовательности.
4
Предложенный подход обеспечивает рациональную основу для отбора экспериментальных данных, выбора моделей и оценки методов в задачах белковой инженерии и прогнозирования функций вариантов.
5
В работе предложена система для выявления причин успеха или неудачи различных архитектур машинного обучения при прогнозировании соответствия белковых последовательностей.
Research Object
архитектуры машинного обучения для предсказания соответствия белковых последовательностей на смоделированных и эмпирических ландшафтах приспособленности
Research Subject
детерминанты эффективности предсказания, включая интерполяцию и экстраполяцию, устойчивость к изрезанности ландшафта и разреженным данным, позиционную экстраполяцию и чувствительность к длине последовательности
Publication Details
Publication Date
2025-07-21
Journal
Publisher
ISSN
Cited by
6
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest