Обзор инструментов с открытым исходным кодом для машинного обучения на больших данных в экосистеме Hadoop

A survey of open source tools for machine learning with big data in the Hadoop ecosystem
Taghi M. Khoshgoftaar, Sara Landset, Aaron N. Richter, Tawfiq Hasanin
2015-11-05

экосистема Hadoopмашинное обучение для больших данныхраспределённая обработкафреймворки машинного обучениямасштабируемость
С постоянно растущим числом доступных вариантов выбор инструментов машинного обучения для работы с большими данными может быть затруднительным. Доступные инструменты имеют свои преимущества и недостатки, а области их применения во многих случаях пересекаются. Объём данных в мире быстро увеличивается, и традиционные инструменты машинного обучения становятся недостаточными по мере перехода к распределённой обработке данных и обработке в реальном времени. Эта статья предназначена для исследователей и специалистов, знакомых с машинным обучением, но не имеющих достаточного опыта работы с большими данными. Для оценки инструментов необходимо хорошо понимать, на какие характеристики следует обращать внимание. С этой целью в статье представлен перечень критериев выбора, а также анализ преимуществ и недостатков каждого инструмента. Сначала рассматривается, что именно означает термин «большие данные». Затем внимание переключается на экосистему Hadoop, где анализируется множество проектов, входящих в типичную архитектуру машинного обучения, и рассматривается, как они могут взаимодействовать. Обсуждаются преимущества и недостатки трёх различных парадигм обработки данных, а также сравниваются реализующие их вычислительные платформы, включая MapReduce, Spark, Flink, Storm и H2O. Далее рассматриваются библиотеки и фреймворки машинного обучения, включая Mahout, MLlib и SAMOA, и проводится их оценка по таким критериям, как масштабируемость, простота использования и расширяемость. Единого набора инструментов, действительно обеспечивающего универсальное решение, не существует, поэтому цель статьи — упростить принятие решений, предоставив максимально полную информацию и количественно оценив связанные с выбором компромиссы. Кроме того, на протяжении всей статьи рассматриваются современные исследования в этой области, использующие данные инструменты, и обсуждаются возможные направления дальнейшего развития обучения на основе наборов инструментов.
1
Предложены критерии выбора инструментов, включая масштабируемость, простоту использования, расширяемость, а также компромиссы между их преимуществами и недостатками.
2
Оцениваются библиотеки и фреймворки машинного обучения, такие как Mahout, MLlib и SAMOA, в контексте архитектур на базе Hadoop.
3
Сделан вывод, что универсального инструментария не существует, поэтому выбор инструментов требует анализа компромиссов с учётом конкретной рабочей нагрузки.
4
В статье представлен обзор открытых инструментов машинного обучения для больших данных в экосистеме Hadoop, ориентированный на специалистов без опыта работы с большими данными.
5
Сравниваются парадигмы обработки и соответствующие движки, включая MapReduce, Spark, Flink, Storm и H2O, для распределённого и потокового машинного обучения.

Инструменты и фреймворки с открытым исходным кодом для машинного обучения и обработки больших данных в экосистеме Hadoop

Их сравнительные возможности и компромиссы, в частности масштабируемость, удобство использования, расширяемость, парадигмы обработки и пригодность для распределённого машинного обучения в реальном времени

Publication Details
Publication Date
2015-11-05
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Taghi M. Khoshgoftaar
Sara Landset
Aaron N. Richter
Tawfiq Hasanin
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat →
Make a presentation
100%