Статистическая модель идентификации белков методом тандемной масс-спектрометрии

A Statistical Model for Identifying Proteins by Tandem Mass Spectrometry
Ruedi Aebersold, Alexey I. Nesvizhskii, Eugene Kolker, Andrew Keller
2003-07-15

алгоритм ожидание‑максимизацияуровень ложноположительных идентификацийсопоставление пептидов со спектрамиидентификация белковтандемная масс-спектрометрия
Представлена статистическая модель для вычисления вероятностей наличия белков в образце на основе пептидов, сопоставленных с тандемными масс-спектрами (MS/MS), полученными после протеолитического гидролиза образца. Пептиды, соответствующие более чем одному белку в последовательностной базе данных, распределяются между всеми соответствующими белками, а минимальный список белков, достаточный для объяснения наблюдаемых пептидных сопоставлений, выводится с помощью алгоритма ожидания-максимизации. На примере сопоставлений пептидов со спектрами, полученных от образца 18 очищенных белков, а также на сложных образцах Haemophilus influenzae и Halobacterium показано, что модель даёт точные вероятности и обладает высокой мощностью различать правильные и ошибочные идентификации белков. Этот метод позволяет фильтровать крупномасштабные наборы данных протеомики с предсказуемой чувствительностью и уровнем ошибок ложноположительных идентификаций. Быстрая, последовательная и прозрачная, модель обеспечивает стандарт для публикации крупномасштабных наборов данных по идентификации белков в литературе и для сравнения результатов различных экспериментов.
1
Статистическая модель вычисляет вероятности присутствия белков на основе пептидов, сопоставленных с тандемными MS/MS спектрами после протеолитического гидролиза.
2
Пептиды, соответствующие нескольким белкам, распределяются между этими белками с помощью алгоритма ожидания‑максимизации (EM) для получения минимального списка белков, объясняющего наблюдаемые пептиды.
3
Подход быстр, согласован, прозрачен и пригоден в качестве стандарта для публикации и сравнения результатов крупномасштабной идентификации белков.
4
Метод позволяет фильтровать большие наборы протеомных данных с предсказуемой чувствительностью и уровнем ложноположительных идентификаций.
5
При применении к выборке из 18 очищенных белков и комплексным образцам H. influenzae и Halobacterium модель даёт точные вероятности присутствия белков и хорошо различает правильные и ошибочные идентификации.

Белки, присутствующие в биологическом образце, выявляемые по пептидным присвоениям тандемной масс-спектрометрии (MS/MS)

Статистический расчёт вероятностей присутствия белков и вывод минимального списка белков на основе соответствий пептидов спектрам (включая распределение пептидов, общих для нескольких белков) для управления чувствительностью и уровнем ложноположительных идентификаций

Publication Details
Publication Date
2003-07-15
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Ruedi Aebersold
Alexey I. Nesvizhskii
Eugene Kolker
Andrew Keller
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%