Обзор инструментов с открытым исходным кодом для машинного обучения на больших данных в экосистеме Hadoop
A survey of open source tools for machine learning with big data in the Hadoop ecosystem
2015-11-05
SCID: 54.1/rpdktm7e
Discuss with AI
экосистема Hadoopмашинное обучение для больших данныхраспределённая обработкафреймворки машинного обучениямасштабируемость
Figures from the paper
Abstract (AI)
С постоянно растущим числом доступных вариантов выбор инструментов машинного обучения для работы с большими данными может быть затруднительным. Доступные инструменты имеют свои преимущества и недостатки, а области их применения во многих случаях пересекаются. Объём данных в мире быстро увеличивается, и традиционные инструменты машинного обучения становятся недостаточными по мере перехода к распределённой обработке данных и обработке в реальном времени. Эта статья предназначена для исследователей и специалистов, знакомых с машинным обучением, но не имеющих достаточного опыта работы с большими данными. Для оценки инструментов необходимо хорошо понимать, на какие характеристики следует обращать внимание. С этой целью в статье представлен перечень критериев выбора, а также анализ преимуществ и недостатков каждого инструмента. Сначала рассматривается, что именно означает термин «большие данные». Затем внимание переключается на экосистему Hadoop, где анализируется множество проектов, входящих в типичную архитектуру машинного обучения, и рассматривается, как они могут взаимодействовать. Обсуждаются преимущества и недостатки трёх различных парадигм обработки данных, а также сравниваются реализующие их вычислительные платформы, включая MapReduce, Spark, Flink, Storm и H2O. Далее рассматриваются библиотеки и фреймворки машинного обучения, включая Mahout, MLlib и SAMOA, и проводится их оценка по таким критериям, как масштабируемость, простота использования и расширяемость. Единого набора инструментов, действительно обеспечивающего универсальное решение, не существует, поэтому цель статьи — упростить принятие решений, предоставив максимально полную информацию и количественно оценив связанные с выбором компромиссы. Кроме того, на протяжении всей статьи рассматриваются современные исследования в этой области, использующие данные инструменты, и обсуждаются возможные направления дальнейшего развития обучения на основе наборов инструментов.
Key Findings
1
Предложены критерии выбора инструментов, включая масштабируемость, простоту использования, расширяемость, а также компромиссы между их преимуществами и недостатками.
2
Оцениваются библиотеки и фреймворки машинного обучения, такие как Mahout, MLlib и SAMOA, в контексте архитектур на базе Hadoop.
3
Сделан вывод, что универсального инструментария не существует, поэтому выбор инструментов требует анализа компромиссов с учётом конкретной рабочей нагрузки.
4
В статье представлен обзор открытых инструментов машинного обучения для больших данных в экосистеме Hadoop, ориентированный на специалистов без опыта работы с большими данными.
5
Сравниваются парадигмы обработки и соответствующие движки, включая MapReduce, Spark, Flink, Storm и H2O, для распределённого и потокового машинного обучения.
Research Object
Инструменты и фреймворки с открытым исходным кодом для машинного обучения и обработки больших данных в экосистеме Hadoop
Research Subject
Их сравнительные возможности и компромиссы, в частности масштабируемость, удобство использования, расширяемость, парадигмы обработки и пригодность для распределённого машинного обучения в реальном времени
Publication Details
Publication Date
2015-11-05
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest