К масштабируемым системам аналитики больших данных: технологическое руководство

Toward Scalable Systems for Big Data Analytics: A Technology Tutorial
Tat‐Seng Chua, Xuelong Li, Yonggang Wen, Han Hu
2014-01-01

фреймворк Hadoopаналитика больших данныхсистемы больших данныхцепочка создания стоимости больших данныхоценочные бенчмарки
За последние два десятилетия технологические достижения привели к лавинообразному росту объема данных, поступающих из различных областей (например, здравоохранения и научных датчиков, пользовательских данных, интернет-компаний и финансовых организаций, а также систем управления цепочками поставок). Для обозначения этой формирующейся тенденции был введен термин «большие данные». Помимо огромного объема, большие данные обладают и другими уникальными характеристиками по сравнению с традиционными данными. Например, большие данные часто имеют неструктурированный характер и требуют более оперативного анализа в реальном времени. Это развитие обусловливает необходимость создания новых системных архитектур для получения, передачи и хранения данных, а также механизмов обработки данных в больших масштабах. В статье представлен обзор литературы и технологическое руководство по платформам аналитики больших данных, призванные дать целостное представление читателям-неспециалистам и сформировать у более подготовленной аудитории практический подход, позволяющий самостоятельно адаптировать решения для работы с большими данными. Сначала дается определение больших данных и обсуждаются связанные с ними проблемы. Затем предлагается систематическая структура декомпозиции систем больших данных на четыре последовательных модуля: генерация данных, получение данных, хранение данных и аналитика данных. Эти четыре модуля образуют цепочку создания ценности больших данных. Далее представлен подробный обзор многочисленных подходов и механизмов, разработанных научным и промышленным сообществами. Кроме того, рассматривается широко распространенная платформа Hadoop для решения задач, связанных с большими данными. Наконец, обозначены несколько эталонных наборов тестов для оценки и перспективных направлений исследований в области систем больших данных.
1
Большие данные характеризуются не только огромным объёмом, но и такими свойствами, как неструктурированные форматы и необходимость анализа в реальном времени.
2
Hadoop представлен как широко распространённый фреймворк для решения задач управления и аналитики больших данных.
3
В статье предложена четырёхмодульная структура: генерация данных, их получение, хранение и аналитика, образующая цепочку создания ценности больших данных.
4
В статье обобщаются эталонные тесты для оценки систем больших данных и обозначаются перспективные направления дальнейших исследований.
5
В обзоре рассматриваются исследовательские и промышленные подходы к построению масштабируемых архитектур на всех этапах обработки больших данных.

Платформы аналитики больших данных / системы больших данных (модули: генерация данных, сбор/приём данных, хранение данных, аналитика)

системные архитектуры, механизмы и оценка цепочки создания ценности данных — генерации, сбора, хранения и аналитики — для масштабируемой обработки больших данных

Publication Details
Publication Date
2014-01-01
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Tat‐Seng Chua
Xuelong Li
Yonggang Wen
Han Hu
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%