Методы обработки метаболомных данных UHPLC-MS без целевой направленности: сравнительное исследование нормализации, заполнения пропусков, преобразования и масштабирования

Non-targeted UHPLC-MS metabolomic data processing methods: a comparative investigation of normalisation, missing value imputation, transformation and scaling
Ralf J. M. Weber, Mark R. Viant, Ulf Sommer, Warwick B. Dunn, Riccardo Di Guida, Jasper Engel, J. William Allwood, Martin R. Jones
2016-04-14

рекомендации по предобработке для PCA и PLS-DAнормализация PQNобработка данных метаболомики UHPLC-MSпреобразование glog (обобщённый логарифм)импутация пропущенных значений (Random Forest, KNN, отсутствие)
ВВЕДЕНИЕ: Типичный рабочий процесс обработки метаболомных данных включает последовательный набор процедур, таких как выделение пиков, контроль качества, нормализация, заполнение пропусков, преобразование и масштабирование. Комбинация этих процедур должна представить экспериментальные данные в подходящей структуре для выявления биологических изменений валидным и устойчивым образом. ЦЕЛИ: В настоящее время разные исследователи применяют различные методы обработки данных, и оценка перестановок, применяемых к наборам данных UHPLC-MS, не была опубликована. Здесь мы ставим цель определить наиболее подходящий рабочий процесс обработки данных. МЕТОДЫ: Мы оцениваем влияние методов нормализации, заполнения пропусков, преобразования и масштабирования на унивариантный и мультивариантный анализ наборов данных UHPLC-MS, полученных для различных млекопитающих образцов. РЕЗУЛЬТАТЫ: По результатам исчерпывающей оценки мы рекомендуем вероятностнуюquotient-нормализацию (probabilistic quotient normalization, PQN) без заполнения пропусков и без преобразования или масштабирования для унивариантного анализа. Для анализа главных компонент (PCA) мы рекомендуем применение PQN с заполнением пропусков методом Random Forest, обобщённым логарифмическим преобразованием (glog) и без масштабирования. Для частотных PLS-DA (partial least squares discriminant analysis) мы рекомендуем PQN, k-ближайших соседей (KNN) в качестве метода заполнения пропусков, обобщённое логарифмическое преобразование и отсутствие масштабирования. Эти рекомендации основаны на поиске биологически важных метаболитных признаков независимо от их измеренной интенсивности. ЗАКЛЮЧЕНИЕ: Соответствующий выбор методов нормализации, заполнения пропусков, преобразования и масштабирования отличается в зависимости от метода анализа данных, и выбор метода имеет решающее значение для максимизации биологических выводов из наборов данных UHPLC-MS.
1
Для PCA рекомендуется нормализация PQN в сочетании с иммутацией пропущенных значений методом Random Forest, преобразованием generalized log (glog) и без масштабирования.
2
Для PLS-DA рекомендуется нормализация PQN с иммутацией пропущенных значений методом KNN, преобразованием generalized logarithm и без масштабирования.
3
Для унивариантного анализа рекомендуется Probabilistic Quotient Normalisation (PQN) без иммутации пропущенных значений и без преобразования или масштабирования.
4
Выбор предобработки в зависимости от метода должен быть нацелен на выявление биологически важных метаболитов независимо от их измеренной интенсивности.
5
Комбинация нормализации, иммутации пропущенных значений, преобразования и масштабирования существенно влияет на унивариантный и мультивариантный анализ UHPLC-MS метаболомных данных.

Неприцельные данные метаболомики UHPLC-MS, полученные из образцов млекопитающих

Влияние различных методов обработки данных (нормализация, импутация пропущенных значений, преобразование и масштабирование) на унияллный и мультивариантный анализ и выделение биологически важных метаболитных признаков

Publication Details
Publication Date
2016-04-14
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Ralf J. M. Weber
Mark R. Viant
Ulf Sommer
Warwick B. Dunn
Riccardo Di Guida
Jasper Engel
J. William Allwood
Martin R. Jones
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%