Анализ больших данных в здравоохранении: Apache Hadoop, Apache Spark и Apache Flink
BigData Analysis in Healthcare: Apache Hadoop , Apache spark and Apache Flink
2019-07-27
SCID: 54.1/tjbgvxqv
Discuss with AI
Apache FlinkApache Hadoop MapReduceApache SparkАналитика больших данныхОбработка медицинских данных
Figures from the paper
Abstract (AI)
Введение: Объем данных в здравоохранении увеличивается. Корректный анализ этих данных может повысить качество медицинской помощи и снизить затраты. Такие данные характеризуются большим объемом, разнообразием и высокой скоростью генерации, что делает их анализ с использованием обычных аппаратных и программных платформ невозможным. Поэтому выбор подходящей платформы для управления данными такого типа имеет большое значение. Цель исследования — представить и сравнить наиболее популярную и широко используемую платформу для обработки больших данных Apache Hadoop MapReduce, а также платформы Apache Spark и Apache Flink, которые в последнее время приобрели широкую известность. Материалы и методы: Исследование представляет собой обзор, основанный на поиске публикаций в базах данных ProQuest, PubMed, Google Scholar, ScienceDirect, Scopus, IranMedex, Irandoc, Magiran, ParsMedline и Scientific Information Database (SID), а также на анализе веб-обзоров и специализированных книг по соответствующим ключевым словам и стандартам. Всего было изучено 80 статей, связанных с темой исследования. Результаты: Полученные данные показали, что каждая из изученных платформ обладает определенными характеристиками в отношении обработки данных, поддержки различных языков программирования, скорости обработки, вычислительной модели, управления памятью, оптимизации, задержки, отказоустойчивости, масштабируемости, производительности, совместимости, безопасности и других параметров. В целом результаты показали, что среда Apache Hadoop отличается простотой, обнаружением ошибок и управлением масштабируемостью на основе кластеров. Однако, поскольку ее обработка основана на пакетном режиме, она подходит для более медленного выполнения сложного анализа и не поддерживает потоковую обработку. Apache Spark представляет собой распределенную вычислительную платформу, способную обрабатывать большие наборы данных в оперативной памяти с очень быстрым временем отклика. Apache Flink позволяет пользователям хранить данные в памяти и загружать их многократно, обеспечивая при этом сложный механизм отказоустойчивости, который непрерывно восстанавливает состояние потока данных. Заключение: Применение платформ для анализа и обработки больших данных...
Key Findings
1
Apache Flink поддерживает многократный доступ к данным в памяти и обеспечивает сложную отказоустойчивость за счет непрерывного восстановления состояния потоков данных.
2
Apache Hadoop обеспечивает простоту, обнаружение ошибок и управление масштабируемостью кластеров, однако его пакетная обработка непригодна для потоковых данных и медленна при сложном анализе.
3
Apache Spark обрабатывает большие наборы данных в памяти как распределенная вычислительная платформа, обеспечивая очень быстрое время отклика.
4
Большой объем, разнообразие и высокая скорость формирования медицинских данных делают обычные аппаратные и программные платформы недостаточными для их эффективного анализа.
5
В исследовании рассматриваются и сравниваются Apache Hadoop MapReduce, Apache Spark и Apache Flink для обработки больших медицинских данных на основе 80 публикаций.
Research Object
Платформы обработки больших данных в здравоохранении, в частности Apache Hadoop MapReduce, Apache Spark и Apache Flink
Research Subject
Сравнительные возможности обработки и характеристики производительности, включая скорость обработки, вычислительную модель, управление памятью, оптимизацию, задержку, отказоустойчивость, масштабируемость, совместимость и безопасность
Publication Details
Publication Date
2019-07-27
Journal
Publisher
ISSN
Cited by
57
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest