К масштабируемым системам аналитики больших данных: технологическое руководство
Toward Scalable Systems for Big Data Analytics: A Technology Tutorial
2014-01-01
SCID: 54.1/anah8dv9
Discuss with AI
фреймворк Hadoopаналитика больших данныхсистемы больших данныхцепочка создания стоимости больших данныхоценочные бенчмарки
Figures from the paper
Abstract (AI)
За последние два десятилетия технологические достижения привели к лавинообразному росту объема данных, поступающих из различных областей (например, здравоохранения и научных датчиков, пользовательских данных, интернет-компаний и финансовых организаций, а также систем управления цепочками поставок). Для обозначения этой формирующейся тенденции был введен термин «большие данные». Помимо огромного объема, большие данные обладают и другими уникальными характеристиками по сравнению с традиционными данными. Например, большие данные часто имеют неструктурированный характер и требуют более оперативного анализа в реальном времени. Это развитие обусловливает необходимость создания новых системных архитектур для получения, передачи и хранения данных, а также механизмов обработки данных в больших масштабах. В статье представлен обзор литературы и технологическое руководство по платформам аналитики больших данных, призванные дать целостное представление читателям-неспециалистам и сформировать у более подготовленной аудитории практический подход, позволяющий самостоятельно адаптировать решения для работы с большими данными. Сначала дается определение больших данных и обсуждаются связанные с ними проблемы. Затем предлагается систематическая структура декомпозиции систем больших данных на четыре последовательных модуля: генерация данных, получение данных, хранение данных и аналитика данных. Эти четыре модуля образуют цепочку создания ценности больших данных. Далее представлен подробный обзор многочисленных подходов и механизмов, разработанных научным и промышленным сообществами. Кроме того, рассматривается широко распространенная платформа Hadoop для решения задач, связанных с большими данными. Наконец, обозначены несколько эталонных наборов тестов для оценки и перспективных направлений исследований в области систем больших данных.
Key Findings
1
Большие данные характеризуются не только огромным объёмом, но и такими свойствами, как неструктурированные форматы и необходимость анализа в реальном времени.
2
Hadoop представлен как широко распространённый фреймворк для решения задач управления и аналитики больших данных.
3
В статье предложена четырёхмодульная структура: генерация данных, их получение, хранение и аналитика, образующая цепочку создания ценности больших данных.
4
В статье обобщаются эталонные тесты для оценки систем больших данных и обозначаются перспективные направления дальнейших исследований.
5
В обзоре рассматриваются исследовательские и промышленные подходы к построению масштабируемых архитектур на всех этапах обработки больших данных.
Research Object
Платформы аналитики больших данных / системы больших данных (модули: генерация данных, сбор/приём данных, хранение данных, аналитика)
Research Subject
системные архитектуры, механизмы и оценка цепочки создания ценности данных — генерации, сбора, хранения и аналитики — для масштабируемой обработки больших данных
Publication Details
Publication Date
2014-01-01
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest