Отбор признаков

Feature Selection
Huan Liu, Suhang Wang, Jiliang Tang, Jundong Li, Fred Morstatter, Kewei Cheng, Robert P. Treviño
2017-12-06

большие данныеотбор признаковданные высокой размерностиразреженное обучениепотоковые данные
Отбор признаков как стратегия предварительной обработки данных доказал свою эффективность и вычислительную результативность при подготовке данных, особенно многомерных, для решения различных задач интеллектуального анализа данных и машинного обучения. К целям отбора признаков относятся построение более простых и понятных моделей, повышение эффективности интеллектуального анализа данных и подготовка чистых, интерпретируемых данных. Недавнее стремительное распространение больших данных создало существенные проблемы и новые возможности для отбора признаков. В данном обзорном исследовании представлен всесторонний и структурированный обзор последних достижений в области отбора признаков. Учитывая актуальные проблемы и возможности эпохи больших данных, мы повторно рассматриваем исследования по отбору признаков с точки зрения данных и анализируем репрезентативные алгоритмы отбора признаков для традиционных, структурированных, гетерогенных и потоковых данных. С методологической точки зрения, чтобы подчеркнуть различия и сходства большинства существующих алгоритмов отбора признаков для традиционных данных, мы подразделяем их на четыре основные группы: методы на основе сходства, информационно-теоретические методы, методы на основе разреженного обучения и статистические методы. Для содействия развитию исследований в данной области мы также представляем репозиторий алгоритмов отбора признаков с открытым исходным кодом, содержащий большинство популярных алгоритмов отбора признаков (http://featureselection.asu.edu/). Кроме того, мы используем его в качестве примера, демонстрирующего способы оценки алгоритмов отбора признаков. В заключительной части обзора обсуждаются некоторые нерешённые проблемы и вызовы, требующие большего внимания в будущих исследованиях.
1
Отбор признаков улучшает подготовку многомерных данных, обеспечивая более простые, интерпретируемые модели и потенциально повышая эффективность анализа данных.
2
Для обычных данных алгоритмы отбора признаков классифицируются на методы на основе сходства, информационно-теоретические, разреженного обучения и статистические методы.
3
Авторы представляют репозиторий с открытым исходным кодом, содержащий популярные алгоритмы отбора признаков, и показывают его применение для оценки алгоритмов.
4
В обзоре выделены нерешённые проблемы и задачи, обусловленные возможностями и сложностями отбора признаков в эпоху больших данных.
5
В обзоре систематизированы современные исследования по отбору признаков для обычных, структурированных, неоднородных и потоковых данных.

отбор признаков для обычных, структурированных, гетерогенных и потоковых данных, особенно для многомерных и больших данных

современные алгоритмы отбора признаков, их ориентированная на данные классификация и оценка, а также открытые проблемы в условиях больших данных

Publication Details
Publication Date
2017-12-06
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Huan Liu
Suhang Wang
Jiliang Tang
Jundong Li
Fred Morstatter
Kewei Cheng
Robert P. Treviño
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%