Исследование факторов, определяющих эффективность машинного обучения при прогнозировании приспособленности белков

Investigating the determinants of performance in machine learning for protein fitness prediction
Mahakaran Sandhu, Adam C. Mater, Dana S. Matthews, Matthew A. Spence, Artem Lenskiy, Colin J. Jackson
2025-07-21

эпистаз и сложность ландшафталандшафты приспособленностипозиционная экстраполяцияпредсказание приспособленности белковпредсказание зависимости «последовательность–приспособленность»
Машинное обучение (МО) произвело революцию в биологии белков, позволив решить давние задачи, связанные со сворачиванием белков, генерацией каркасов и конструированием функций. Различные архитектуры продемонстрировали высокую эффективность в задачах обучения с учителем для прогнозирования приспособленности белков. Однако в отсутствие рациональных подходов к оценке того, какие архитектуры оптимальны для конкретных наборов данных и задач инженерии, выбор архитектуры остается сложным. Здесь мы предлагаем систему для исследования факторов, определяющих успешность различных архитектур МО. Используя смоделированные (модель NK) и эмпирические ландшафты приспособленности, мы оцениваем прогнозирование зависимости «последовательность—приспособленность» по шести ключевым показателям эффективности: интерполяции внутри области обучения, экстраполяции за пределы области обучения, устойчивости к увеличению эпистаза/шероховатости, способности выполнять позиционную экстраполяцию, устойчивости к разреженным обучающим данным и чувствительности к длине последовательности. Мы показываем, что архитектурные различия между алгоритмами стабильно влияют на эффективность по этим показателям как на экспериментальных, так и на теоретических ландшафтах. Кроме того, шероховатость ландшафта оказывается одним из главных факторов, определяющих точность прогнозирования зависимости «последовательность—приспособленность». Наша методология и результаты предлагают рациональную стратегию отбора экспериментальных данных, выбора моделей и их оценки, основанную на теории ландшафтов приспособленности; мы надеемся, что она будет способствовать повышению точности прогнозирования зависимости «последовательность—приспособленность» и окажет влияние на инженерный дизайн белков и прогнозирование функций вариантов.
1
Архитектурные различия стабильно влияют на результаты как на смоделированных ландшафтах NK, так и на эмпирических ландшафтах приспособленности белков.
2
Шероховатость ландшафта приспособленности выявлена как один из основных факторов точности прогнозирования соответствия последовательностей.
3
Производительность оценивается по интерполяции, экстраполяции, устойчивости к эпистазу, позиционной экстраполяции, работе с разреженными данными и чувствительности к длине последовательности.
4
Предложенный подход обеспечивает рациональную основу для отбора экспериментальных данных, выбора моделей и оценки методов в задачах белковой инженерии и прогнозирования функций вариантов.
5
В работе предложена система для выявления причин успеха или неудачи различных архитектур машинного обучения при прогнозировании соответствия белковых последовательностей.

архитектуры машинного обучения для предсказания соответствия белковых последовательностей на смоделированных и эмпирических ландшафтах приспособленности

детерминанты эффективности предсказания, включая интерполяцию и экстраполяцию, устойчивость к изрезанности ландшафта и разреженным данным, позиционную экстраполяцию и чувствительность к длине последовательности

Publication Details
Publication Date
2025-07-21
Journal
Publisher
ISSN
Cited by
6
Access Type
Author Information
Authors
Mahakaran Sandhu
Adam C. Mater
Dana S. Matthews
Matthew A. Spence
Artem Lenskiy
Colin J. Jackson
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%