Методы обработки метаболомных данных UHPLC-MS без целевой направленности: сравнительное исследование нормализации, заполнения пропусков, преобразования и масштабирования
Non-targeted UHPLC-MS metabolomic data processing methods: a comparative investigation of normalisation, missing value imputation, transformation and scaling
2016-04-14
SCID: 54.1/vwzzjssg
Discuss with AI
рекомендации по предобработке для PCA и PLS-DAнормализация PQNобработка данных метаболомики UHPLC-MSпреобразование glog (обобщённый логарифм)импутация пропущенных значений (Random Forest, KNN, отсутствие)
Figures from the paper
Abstract (AI)
ВВЕДЕНИЕ: Типичный рабочий процесс обработки метаболомных данных включает последовательный набор процедур, таких как выделение пиков, контроль качества, нормализация, заполнение пропусков, преобразование и масштабирование. Комбинация этих процедур должна представить экспериментальные данные в подходящей структуре для выявления биологических изменений валидным и устойчивым образом. ЦЕЛИ: В настоящее время разные исследователи применяют различные методы обработки данных, и оценка перестановок, применяемых к наборам данных UHPLC-MS, не была опубликована. Здесь мы ставим цель определить наиболее подходящий рабочий процесс обработки данных. МЕТОДЫ: Мы оцениваем влияние методов нормализации, заполнения пропусков, преобразования и масштабирования на унивариантный и мультивариантный анализ наборов данных UHPLC-MS, полученных для различных млекопитающих образцов. РЕЗУЛЬТАТЫ: По результатам исчерпывающей оценки мы рекомендуем вероятностнуюquotient-нормализацию (probabilistic quotient normalization, PQN) без заполнения пропусков и без преобразования или масштабирования для унивариантного анализа. Для анализа главных компонент (PCA) мы рекомендуем применение PQN с заполнением пропусков методом Random Forest, обобщённым логарифмическим преобразованием (glog) и без масштабирования. Для частотных PLS-DA (partial least squares discriminant analysis) мы рекомендуем PQN, k-ближайших соседей (KNN) в качестве метода заполнения пропусков, обобщённое логарифмическое преобразование и отсутствие масштабирования. Эти рекомендации основаны на поиске биологически важных метаболитных признаков независимо от их измеренной интенсивности. ЗАКЛЮЧЕНИЕ: Соответствующий выбор методов нормализации, заполнения пропусков, преобразования и масштабирования отличается в зависимости от метода анализа данных, и выбор метода имеет решающее значение для максимизации биологических выводов из наборов данных UHPLC-MS.
Key Findings
1
Для PCA рекомендуется нормализация PQN в сочетании с иммутацией пропущенных значений методом Random Forest, преобразованием generalized log (glog) и без масштабирования.
2
Для PLS-DA рекомендуется нормализация PQN с иммутацией пропущенных значений методом KNN, преобразованием generalized logarithm и без масштабирования.
3
Для унивариантного анализа рекомендуется Probabilistic Quotient Normalisation (PQN) без иммутации пропущенных значений и без преобразования или масштабирования.
4
Выбор предобработки в зависимости от метода должен быть нацелен на выявление биологически важных метаболитов независимо от их измеренной интенсивности.
5
Комбинация нормализации, иммутации пропущенных значений, преобразования и масштабирования существенно влияет на унивариантный и мультивариантный анализ UHPLC-MS метаболомных данных.
Research Object
Неприцельные данные метаболомики UHPLC-MS, полученные из образцов млекопитающих
Research Subject
Влияние различных методов обработки данных (нормализация, импутация пропущенных значений, преобразование и масштабирование) на унияллный и мультивариантный анализ и выделение биологически важных метаболитных признаков
Publication Details
Publication Date
2016-04-14
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest