Приложения и проблемы глубокого обучения в аналитике больших данных
Deep learning applications and challenges in big data analytics
2015-02-23
SCID: 54.1/3b4d3hnw
Discuss with AI
Аналитика больших данныхГлубокое обучениераспределённые вычислениясемантическая индексацияпотоковые данные
Figures from the paper
Abstract (AI)
Аналитика больших данных и глубокое обучение являются двумя основными направлениями в науке о данных. Большие данные стали важны, поскольку многие организации, как государственные, так и частные, собирают огромные объёмы предметно-ориентированной информации, которая может содержать полезные сведения для задач, таких как национальная разведка, кибербезопасность, обнаружение мошенничества, маркетинг и медицинская информатика. Такие компании, как Google и Microsoft, анализируют большие объёмы данных для бизнес-анализа и принятия решений, влияя на существующие и будущие технологии. Алгоритмы глубокого обучения извлекают высокоуровневые, сложные абстракции в виде представлений данных через иерархический процесс обучения: сложные абстракции на данном уровне усваиваются на основе относительно более простых абстракций, сформированных на предыдущем уровне иерархии. Ключевое преимущество глубокого обучения — анализ и обучение на больших объёмах неконтролируемых данных, что делает его ценным инструментом для аналитики больших данных, где исходные данные в основном неразмечены и не категоризированы. В настоящем исследовании мы изучаем, как глубокое обучение может быть использовано для решения важных задач аналитики больших данных, включая извлечение сложных закономерностей из огромных объёмов данных, семантическую индексацию, пометку данных, оперативный поиск информации и упрощение дискриминативных задач. Мы также рассматриваем аспекты исследований глубокого обучения, требующие дальнейшего изучения для учёта специфических проблем, вносимых аналитикой больших данных, включая потоковые данные, высокоразмерные данные, масштабируемость моделей и распределённые вычисления. В заключение мы представляем соображения относительно будущих работ и формулируем ряд вопросов, в том числе определение критериев выборки данных, моделирование адаптации к домену, определение критериев получения полезных абстракций данных, улучшение семантической индексации, полунал supervisied обучение и активное обучение.
Key Findings
1
Остались проблемы применения глубокого обучения к большим данным, в частности обработка потоковых данных, высокоразмерных данных, масштабируемость моделей и распределённые вычисления.
2
Глубокое обучение может решать задачи больших данных, такие как извлечение сложных шаблонов, семантическая индексация, тегирование данных, быстрое извлечение информации и упрощение задач дискриминации.
3
Глубокое обучение хорошо подходит для аналитики больших данных, так как способно извлекать высокоуровневые сложные абстракции из в основном немаркированных массивных наборов данных посредством иерархического обучения.
4
Дальнейшие направления исследований включают определение критериев выборки данных, моделирование адаптации домена, критерии полезных абстракций данных, улучшение семантической индексации, полуналюченное обучение и активное обучение.
Research Object
Методы глубокого обучения, применяемые в аналитике больших данных (Big Data)
Research Subject
Использование и проблемы глубокого обучения для извлечения сложных закономерностей, семантической индексации, тегирования данных, быстрого поиска информации, упрощения дискриминативных задач, а также для работы со стриминговыми, высокоразмерными, масштабируемыми и распределёнными сценариями больших данных
Publication Details
Publication Date
2015-02-23
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest