Приложения и проблемы глубокого обучения в аналитике больших данных

Deep learning applications and challenges in big data analytics
Taghi M. Khoshgoftaar, Maryam M. Najafabadi, Flavio Villanustre, Naeem Seliya, Randall Wald, Edin Muharemagic
2015-02-23

Аналитика больших данныхГлубокое обучениераспределённые вычислениясемантическая индексацияпотоковые данные
Аналитика больших данных и глубокое обучение являются двумя основными направлениями в науке о данных. Большие данные стали важны, поскольку многие организации, как государственные, так и частные, собирают огромные объёмы предметно-ориентированной информации, которая может содержать полезные сведения для задач, таких как национальная разведка, кибербезопасность, обнаружение мошенничества, маркетинг и медицинская информатика. Такие компании, как Google и Microsoft, анализируют большие объёмы данных для бизнес-анализа и принятия решений, влияя на существующие и будущие технологии. Алгоритмы глубокого обучения извлекают высокоуровневые, сложные абстракции в виде представлений данных через иерархический процесс обучения: сложные абстракции на данном уровне усваиваются на основе относительно более простых абстракций, сформированных на предыдущем уровне иерархии. Ключевое преимущество глубокого обучения — анализ и обучение на больших объёмах неконтролируемых данных, что делает его ценным инструментом для аналитики больших данных, где исходные данные в основном неразмечены и не категоризированы. В настоящем исследовании мы изучаем, как глубокое обучение может быть использовано для решения важных задач аналитики больших данных, включая извлечение сложных закономерностей из огромных объёмов данных, семантическую индексацию, пометку данных, оперативный поиск информации и упрощение дискриминативных задач. Мы также рассматриваем аспекты исследований глубокого обучения, требующие дальнейшего изучения для учёта специфических проблем, вносимых аналитикой больших данных, включая потоковые данные, высокоразмерные данные, масштабируемость моделей и распределённые вычисления. В заключение мы представляем соображения относительно будущих работ и формулируем ряд вопросов, в том числе определение критериев выборки данных, моделирование адаптации к домену, определение критериев получения полезных абстракций данных, улучшение семантической индексации, полунал supervisied обучение и активное обучение.
1
Остались проблемы применения глубокого обучения к большим данным, в частности обработка потоковых данных, высокоразмерных данных, масштабируемость моделей и распределённые вычисления.
2
Глубокое обучение может решать задачи больших данных, такие как извлечение сложных шаблонов, семантическая индексация, тегирование данных, быстрое извлечение информации и упрощение задач дискриминации.
3
Глубокое обучение хорошо подходит для аналитики больших данных, так как способно извлекать высокоуровневые сложные абстракции из в основном немаркированных массивных наборов данных посредством иерархического обучения.
4
Дальнейшие направления исследований включают определение критериев выборки данных, моделирование адаптации домена, критерии полезных абстракций данных, улучшение семантической индексации, полуналюченное обучение и активное обучение.

Методы глубокого обучения, применяемые в аналитике больших данных (Big Data)

Использование и проблемы глубокого обучения для извлечения сложных закономерностей, семантической индексации, тегирования данных, быстрого поиска информации, упрощения дискриминативных задач, а также для работы со стриминговыми, высокоразмерными, масштабируемыми и распределёнными сценариями больших данных

Publication Details
Publication Date
2015-02-23
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Taghi M. Khoshgoftaar
Maryam M. Najafabadi
Flavio Villanustre
Naeem Seliya
Randall Wald
Edin Muharemagic
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%