Сравнение эффективности инструментов предсказания TCR–pMHC выявляет сильную зависимость от данных
Performance comparison of TCR-pMHC prediction tools reveals a strong data dependency
2023-04-18
SCID: 54.1/qgqf23cp
Discuss with AI
предсказание связывания TCR-pMHCдисбаланс данныхобобщение на датасетемодели глубокого обученияустойчивость моделей
Figures from the paper
Abstract (AI)
Взаимодействие T-клеточных рецепторов с молекулами пептид–главный комплекс гистосовместимости (TCR–pMHC) играет ключевую роль в адаптивных иммунных ответах. В настоящее время разработаны различные модели для предсказания связывания TCR–pMHC, однако стандартный набор данных и процедура сравнения эффективности этих подходов по-прежнему отсутствуют. В данной работе предложен общий метод сбора и предварительной обработки данных, их разделения, а также генерации отрицательных примеров; кроме того, представлены комплексные наборы данных для сравнения моделей предсказания TCR–pMHC. Мы собрали, гармонизировали и объединили все основные общедоступные данные о связывании TCR–pMHC и использовали их для сравнения эффективности пяти современных моделей глубокого обучения: TITAN, NetTCR-2.0, ERGO, DLpTCR и ImRex. Оценка эффективности была сосредоточена на двух сценариях: (1) различных методах разделения данных на обучающую и тестовую выборки для оценки способности моделей к обобщению и (2) различных версиях данных, отличающихся размером и дисбалансом пептидов, для оценки устойчивости моделей. Наши результаты показывают, что пять современных моделей не обобщаются на пептиды, отсутствовавшие в обучающей выборке. Мы также показываем, что эффективность моделей сильно зависит от сбалансированности и размера данных, что указывает на относительно низкую устойчивость моделей. Эти результаты свидетельствуют о том, что предсказание связывания TCR–pMHC остается чрезвычайно сложной задачей и требует дальнейшего накопления высококачественных данных и разработки новых алгоритмических подходов.
Key Findings
1
Проведено комплексное сравнение пяти моделей глубокого обучения — TITAN, NetTCR-2.0, ERGO, DLpTCR и ImRex — на объединённых общедоступных данных связывания.
2
Все пять оценённых моделей плохо обобщают результаты на пептиды, отсутствовавшие в обучающих данных.
3
Производительность моделей сильно зависит от размера набора данных и баланса пептидов, что указывает на относительно низкую устойчивость моделей.
4
Предсказание связывания TCR-pMHC остаётся сложной задачей и требует более качественных данных и новых алгоритмических подходов.
5
Исследование предлагает общий рабочий процесс для сбора, гармонизации, предварительной обработки, разделения данных и генерации отрицательных примеров для наборов данных связывания TCR-pMHC.
Research Object
Модели прогнозирования связывания T-клеточных рецепторов с пептидно-главным комплексом гистосовместимости (TCR-pMHC)
Research Subject
Обобщающая способность и устойчивость моделей в зависимости от разбиения данных, размера набора данных и баланса классов пептидов
Publication Details
Publication Date
2023-04-18
Journal
Publisher
ISSN
Cited by
54
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest