Повышение точности предсказания специфичности TCR за счет комбинирования панспецифического и пептид-специфического обучения, масштабирования функции потерь и интеграции сходства последовательностей
Enhancing TCR specificity predictions by combined pan- and peptide-specific training, loss-scaling, and sequence similarity integration
2023-12-20
SCID: 54.1/tpxpeqze
Discuss with AI
пептиды MHC класса INetTCR 2.2предсказание специфичности TCRпанспецифическое моделированиепептид-специфическое моделирование
Figures from the paper
Abstract (AI)
Предсказание взаимодействий между пептидами, представленными главным комплексом гистосовместимости (MHC) класса I, и T-клеточными рецепторами (TCR) имеет большое значение для разработки вакцин, лечения рака и терапии аутоиммунных заболеваний. Однако ограниченный объем данных о парных цепях TCR, смещенный в сторону хорошо изученных эпитопов, препятствует разработке панспецифических моделей машинного обучения (ML). Используя более крупный набор данных о пептидах и TCR, мы исследовали различные модификации архитектур ML-моделей и стратегий обучения для устранения дисбаланса данных. Это привело к общему повышению производительности, особенно для пептидов с небольшим количеством данных о TCR. Тем не менее для ранее не встречавшихся пептидов сохраняются проблемы, особенно если они значительно отличаются от примеров, использованных при обучении. Мы показали, что такие ML-модели можно применять для выявления потенциальных выбросов; удаление этих выбросов из обучающей выборки приводит к дальнейшему повышению производительности. Интеграция панспецифических и пептид-специфических моделей с предсказаниями на основе сходства дополнительно повышает общую производительность, особенно когда требуется низкая частота ложноположительных результатов. В рамках бенчмарка IMMREP22 данная модельная система достигла передовых результатов. Кроме того, сочетание этих стратегий обеспечило приемлемую точность предсказаний для пептидов, охарактеризованных всего 15 положительными TCR. Это наблюдение открывает значительные перспективы для быстрого расширения охвата пептидов существующими моделями предсказания специфичности TCR. Модель NetTCR 2.2, включающая эти усовершенствования, доступна на GitHub (https://github.com/mnielLab/NetTCR-2.2) и в виде веб-сервера по адресу https://services.healthtech.dtu.dk/services/NetTCR-2.2/.
Key Findings
1
Сочетание панспецифического и пептид-специфического обучения с масштабированием функции потерь повышает точность предсказания специфичности TCR, особенно для пептидов с небольшим числом данных о TCR.
2
Интеграция панспецифических, пептид-специфических предсказаний и методов на основе сходства последовательностей дает дополнительные улучшения, особенно при необходимости низкой доли ложноположительных результатов.
3
Общая производительность улучшается, однако предсказания остаются сложными для ранее не встречавшихся пептидов, существенно отличающихся от обучающих примеров.
4
Объединенная модель достигла передового уровня на бенчмарке IMMREP22 и приемлемой точности для пептидов всего с 15 положительными TCR-примерами.
5
Модели способны выявлять потенциальные выбросы; удаление таких образцов из обучающей выборки дополнительно повышает качество предсказаний.
Research Object
Пептиды, представленные MHC класса I, и соответствующие им T-клеточные рецепторы (TCR) с данными по парным цепям
Research Subject
Специфичность взаимодействия TCR с пептидами и прогностическая эффективность интегрированных моделей машинного обучения — панспецифических и пептид-специфических, с масштабированием функции потерь и учётом сходства последовательностей, особенно для редко представленных и ранее не встречавшихся пептидов
Publication Details
Publication Date
2023-12-20
Journal
Publisher
ISSN
Cited by
42
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest