Повышение точности предсказания специфичности TCR за счет комбинирования панспецифического и пептид-специфического обучения, масштабирования функции потерь и интеграции сходства последовательностей

Enhancing TCR specificity predictions by combined pan- and peptide-specific training, loss-scaling, and sequence similarity integration
Mathias Fynbo Jensen, Morten Nielsen
2023-12-20

пептиды MHC класса INetTCR 2.2предсказание специфичности TCRпанспецифическое моделированиепептид-специфическое моделирование
Предсказание взаимодействий между пептидами, представленными главным комплексом гистосовместимости (MHC) класса I, и T-клеточными рецепторами (TCR) имеет большое значение для разработки вакцин, лечения рака и терапии аутоиммунных заболеваний. Однако ограниченный объем данных о парных цепях TCR, смещенный в сторону хорошо изученных эпитопов, препятствует разработке панспецифических моделей машинного обучения (ML). Используя более крупный набор данных о пептидах и TCR, мы исследовали различные модификации архитектур ML-моделей и стратегий обучения для устранения дисбаланса данных. Это привело к общему повышению производительности, особенно для пептидов с небольшим количеством данных о TCR. Тем не менее для ранее не встречавшихся пептидов сохраняются проблемы, особенно если они значительно отличаются от примеров, использованных при обучении. Мы показали, что такие ML-модели можно применять для выявления потенциальных выбросов; удаление этих выбросов из обучающей выборки приводит к дальнейшему повышению производительности. Интеграция панспецифических и пептид-специфических моделей с предсказаниями на основе сходства дополнительно повышает общую производительность, особенно когда требуется низкая частота ложноположительных результатов. В рамках бенчмарка IMMREP22 данная модельная система достигла передовых результатов. Кроме того, сочетание этих стратегий обеспечило приемлемую точность предсказаний для пептидов, охарактеризованных всего 15 положительными TCR. Это наблюдение открывает значительные перспективы для быстрого расширения охвата пептидов существующими моделями предсказания специфичности TCR. Модель NetTCR 2.2, включающая эти усовершенствования, доступна на GitHub (https://github.com/mnielLab/NetTCR-2.2) и в виде веб-сервера по адресу https://services.healthtech.dtu.dk/services/NetTCR-2.2/.
1
Сочетание панспецифического и пептид-специфического обучения с масштабированием функции потерь повышает точность предсказания специфичности TCR, особенно для пептидов с небольшим числом данных о TCR.
2
Интеграция панспецифических, пептид-специфических предсказаний и методов на основе сходства последовательностей дает дополнительные улучшения, особенно при необходимости низкой доли ложноположительных результатов.
3
Общая производительность улучшается, однако предсказания остаются сложными для ранее не встречавшихся пептидов, существенно отличающихся от обучающих примеров.
4
Объединенная модель достигла передового уровня на бенчмарке IMMREP22 и приемлемой точности для пептидов всего с 15 положительными TCR-примерами.
5
Модели способны выявлять потенциальные выбросы; удаление таких образцов из обучающей выборки дополнительно повышает качество предсказаний.

Пептиды, представленные MHC класса I, и соответствующие им T-клеточные рецепторы (TCR) с данными по парным цепям

Специфичность взаимодействия TCR с пептидами и прогностическая эффективность интегрированных моделей машинного обучения — панспецифических и пептид-специфических, с масштабированием функции потерь и учётом сходства последовательностей, особенно для редко представленных и ранее не встречавшихся пептидов

Publication Details
Publication Date
2023-12-20
Journal
Publisher
ISSN
Cited by
42
Access Type
Author Information
Authors
Mathias Fynbo Jensen
Morten Nielsen
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%