большие данныеотбор признаковданные высокой размерностиразреженное обучениепотоковые данные
Figures from the paper
Abstract (AI)
Отбор признаков как стратегия предварительной обработки данных доказал свою эффективность и вычислительную результативность при подготовке данных, особенно многомерных, для решения различных задач интеллектуального анализа данных и машинного обучения. К целям отбора признаков относятся построение более простых и понятных моделей, повышение эффективности интеллектуального анализа данных и подготовка чистых, интерпретируемых данных. Недавнее стремительное распространение больших данных создало существенные проблемы и новые возможности для отбора признаков. В данном обзорном исследовании представлен всесторонний и структурированный обзор последних достижений в области отбора признаков. Учитывая актуальные проблемы и возможности эпохи больших данных, мы повторно рассматриваем исследования по отбору признаков с точки зрения данных и анализируем репрезентативные алгоритмы отбора признаков для традиционных, структурированных, гетерогенных и потоковых данных. С методологической точки зрения, чтобы подчеркнуть различия и сходства большинства существующих алгоритмов отбора признаков для традиционных данных, мы подразделяем их на четыре основные группы: методы на основе сходства, информационно-теоретические методы, методы на основе разреженного обучения и статистические методы. Для содействия развитию исследований в данной области мы также представляем репозиторий алгоритмов отбора признаков с открытым исходным кодом, содержащий большинство популярных алгоритмов отбора признаков (http://featureselection.asu.edu/). Кроме того, мы используем его в качестве примера, демонстрирующего способы оценки алгоритмов отбора признаков. В заключительной части обзора обсуждаются некоторые нерешённые проблемы и вызовы, требующие большего внимания в будущих исследованиях.
Key Findings
1
Отбор признаков улучшает подготовку многомерных данных, обеспечивая более простые, интерпретируемые модели и потенциально повышая эффективность анализа данных.
2
Для обычных данных алгоритмы отбора признаков классифицируются на методы на основе сходства, информационно-теоретические, разреженного обучения и статистические методы.
3
Авторы представляют репозиторий с открытым исходным кодом, содержащий популярные алгоритмы отбора признаков, и показывают его применение для оценки алгоритмов.
4
В обзоре выделены нерешённые проблемы и задачи, обусловленные возможностями и сложностями отбора признаков в эпоху больших данных.
5
В обзоре систематизированы современные исследования по отбору признаков для обычных, структурированных, неоднородных и потоковых данных.
Research Object
отбор признаков для обычных, структурированных, гетерогенных и потоковых данных, особенно для многомерных и больших данных
Research Subject
современные алгоритмы отбора признаков, их ориентированная на данные классификация и оценка, а также открытые проблемы в условиях больших данных
Publication Details
Publication Date
2017-12-06
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest