Сравнение эффективности инструментов предсказания TCR–pMHC выявляет сильную зависимость от данных

Performance comparison of TCR-pMHC prediction tools reveals a strong data dependency
Lihua Deng, Cedric Ly, Sina Abdollahi, Yu Zhao, Immo Prinz, Stefan Bonn
2023-04-18

предсказание связывания TCR-pMHCдисбаланс данныхобобщение на датасетемодели глубокого обученияустойчивость моделей
Взаимодействие T-клеточных рецепторов с молекулами пептид–главный комплекс гистосовместимости (TCR–pMHC) играет ключевую роль в адаптивных иммунных ответах. В настоящее время разработаны различные модели для предсказания связывания TCR–pMHC, однако стандартный набор данных и процедура сравнения эффективности этих подходов по-прежнему отсутствуют. В данной работе предложен общий метод сбора и предварительной обработки данных, их разделения, а также генерации отрицательных примеров; кроме того, представлены комплексные наборы данных для сравнения моделей предсказания TCR–pMHC. Мы собрали, гармонизировали и объединили все основные общедоступные данные о связывании TCR–pMHC и использовали их для сравнения эффективности пяти современных моделей глубокого обучения: TITAN, NetTCR-2.0, ERGO, DLpTCR и ImRex. Оценка эффективности была сосредоточена на двух сценариях: (1) различных методах разделения данных на обучающую и тестовую выборки для оценки способности моделей к обобщению и (2) различных версиях данных, отличающихся размером и дисбалансом пептидов, для оценки устойчивости моделей. Наши результаты показывают, что пять современных моделей не обобщаются на пептиды, отсутствовавшие в обучающей выборке. Мы также показываем, что эффективность моделей сильно зависит от сбалансированности и размера данных, что указывает на относительно низкую устойчивость моделей. Эти результаты свидетельствуют о том, что предсказание связывания TCR–pMHC остается чрезвычайно сложной задачей и требует дальнейшего накопления высококачественных данных и разработки новых алгоритмических подходов.
1
Проведено комплексное сравнение пяти моделей глубокого обучения — TITAN, NetTCR-2.0, ERGO, DLpTCR и ImRex — на объединённых общедоступных данных связывания.
2
Все пять оценённых моделей плохо обобщают результаты на пептиды, отсутствовавшие в обучающих данных.
3
Производительность моделей сильно зависит от размера набора данных и баланса пептидов, что указывает на относительно низкую устойчивость моделей.
4
Предсказание связывания TCR-pMHC остаётся сложной задачей и требует более качественных данных и новых алгоритмических подходов.
5
Исследование предлагает общий рабочий процесс для сбора, гармонизации, предварительной обработки, разделения данных и генерации отрицательных примеров для наборов данных связывания TCR-pMHC.

Модели прогнозирования связывания T-клеточных рецепторов с пептидно-главным комплексом гистосовместимости (TCR-pMHC)

Обобщающая способность и устойчивость моделей в зависимости от разбиения данных, размера набора данных и баланса классов пептидов

Publication Details
Publication Date
2023-04-18
Journal
Publisher
ISSN
Cited by
54
Access Type
Author Information
Authors
Lihua Deng
Cedric Ly
Sina Abdollahi
Yu Zhao
Immo Prinz
Stefan Bonn
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%