Модульное сравнение этапов обработки в нетаргетном метаболомике

Modular comparison of untargeted metabolomics processing steps
Franz Berthiller, Qendrim Zebeli, Markus Aigensberger, Christoph Bueschl, Ezequias Castillo‐Lopez, Sara Ricci, Raul Rivera‐Chacon, Heidi Schwartz
2024-11-27

Compound DiscovererMS-DIALMZmineXCMSанионный обменный хроматографияфильтрация по бланкаммасштабирование данных (автомасштабирование)детекция признаковвысокоразрешающая масс-спектрометрияручная интеграцияимпутация пропущенных значенийнетаргетный метаболомикс
Нетаргетный метаболомический анализ требует надежных стратегий обработки данных для извлечения релевантной информации из исходных данных. Доступно несколько платформ для обработки данных, и выбор программного обеспечения может повлиять на результаты анализа. В этом исследовании приведена всесторонняя оценка четырех рабочих процессов, основанных на широко используемых программах для метаболомики: XCMS, Compound Discoverer, MS-DIAL и MZmine. Эти инструменты были применены к набору данных, полученному из образцов слюны крупного рогатого скота, содержащих добавленные малополярные вещества, и проанализированному методом анионообменной хроматографии в сочетании с высокоразрешающей масс-спектрометрией. Анализ выявил существенные различия в числе и перекрытии обнаруженных признаков: только примерно 8% признаков вошли во все четыре таблицы пиков. Среди перекрывающихся признаков MS-DIAL показал наибольшее сходство с ручной интеграцией, тогда как XCMS и MZmine также продемонстрировали хорошую производительность. Напротив, Compound Discoverer испытывал трудности с надежной интеграцией пиков на высоком базовом уровне. В работе также исследуются различные стратегии постобработки, включая имманацию пропущенных значений, трансформацию, масштабирование и фильтрацию. Оценка пропущенных значений показала, что они преимущественно обусловлены низкой интенсивностью сигналов, поэтому имманация малыми значениями оказалась наиболее эффективной. Не обнаружено однозначных данных в пользу необходимости трансформации для последующих статистических анализов. Автоскейлинг (autoscaling) проявил себя как наиболее подходящая стратегия масштабирования данных. Низкие пороговые значения при фильтрации по бланкам оказались наиболее эффективными для повышения качества данных. Оптимизация порогов фильтрации требует осторожного баланса для удаления избыточной информации при сохранении важной. Работа дает обзор распространенных стратегий в анализе нетаргетной метаболомики, подчеркивая важность тщательного выбора и оптимизации рабочих процессов. Она служит ресурсом для совершенствования стратегий обработки данных с целью получения точных и надежных результатов и предоставляет новые сведения о проблемах, возникающих на протяжении всего конвейера обработки нетаргетной метаболомики. Создано в BioRender. Aigensberger, M. (2024) https://BioRender.com/e63g016. Сформирован простой набор данных из слюны крупного рогатого скота с добавлением 42 соединений, проанализированный методом анионообменной хроматографии и высокоразрешающей масс-спектрометрии. Исследование включает сравнение четырех оптимизированных рабочих процессов на основе XCMS, Compound Discoverer, MS-DIAL и MZmine; ручную классификацию всех обнаруженных признаков на истинно положительные и ложноположительные сигналы; всестороннее сравнение автоматической и ручной интеграции; а также углубленную оценку имманации пропущенных значений, трансформации, масштабирования и фильтрации.
1
Среди перекрывающихся признаков MS-DIAL показал наибольшее сходство с ручной интеграцией; XCMS и MZmine также показали хорошие результаты, в то время как Compound Discoverer испытывал трудности с надёжной интеграцией пиков на высоком базовом уровне.
2
Автомасштабирование (autoscaling) было определено как наиболее подходящая стратегия масштабирования данных.
3
Сравнение четырёх рабочих процессов метаболомики (XCMS, Compound Discoverer, MS-DIAL, MZmine) на наборе данных из бычьей слюны с 42 внесёнными соединениями показало большие различия в обнаруженных признаках.
4
Низкие пороги фильтрации по бланкам улучшали качество данных, но оптимизация порогов фильтрации требует баланса между удалением шума и сохранением важных данных.
5
Пропущенные значения в основном связаны с низкой интенсивностью сигналов, поэтому иммутация малыми значениями оказалась наиболее эффективной.
6
Нет убедительных доказательств необходимости преобразования данных для последующего статистического анализа.
7
Только примерно 8% обнаруженных признаков были общими для всех четырёх инструментов, что свидетельствует о низком совпадении таблиц пиков.

Конвейеры обработки данных в untargeted метаболомике (XCMS, Compound Discoverer, MS-DIAL, MZmine), применённые к набору данных плазмы слюны крупного рогатого скота, подмешанной малыми полярными молекулами, анализированному методом анионообменной хроматографии в комбинации с ВР-МС (LC-HRMS)

Сравнение и оценка шагов обработки и постобработки данных — обнаружение и интеграция пиков и их точность (перекрытие с ручной интеграцией), методы импутации пропущенных значений, трансформации, масштабирования и фильтрации и их влияние на восстановление признаков и качество данных

Publication Details
Publication Date
2024-11-27
Journal
Publisher
ISSN
Cited by
23
Access Type
Author Information
Authors
Franz Berthiller
Qendrim Zebeli
Markus Aigensberger
Christoph Bueschl
Ezequias Castillo‐Lopez
Sara Ricci
Raul Rivera‐Chacon
Heidi Schwartz
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%