Обзор отбора признаков и его методов

A Review of Feature Selection and Its Methods
B. Venkatesh, J. Anuradha
2019-03-01

снижение размерностидинамические данныеизвлечение признаковотбор признаковмасштабируемость
В настоящее время, в эпоху цифровых технологий, объем данных, генерируемых различными приложениями, резко увеличивается как по числу строк, так и по числу столбцов. Это создает узкое место для аналитики и повышает нагрузку на алгоритмы машинного обучения, используемые для распознавания закономерностей. Проблему размерности можно решать с помощью методов снижения размерности. Снижение размерности (DR) может осуществляться двумя способами: отбором признаков (FS) и извлечением признаков (FE). В статье представлен обзор методов отбора признаков. На основании этого обширного обзора можно сделать вывод, что большинство методов FS используют статические данные. Однако с появлением Интернета вещей (IoT) и веб-приложений данные генерируются динамически и быстро увеличиваются в объеме, вследствие чего возрастает вероятность появления зашумленных данных; это также снижает эффективность алгоритмов. По мере увеличения размера набора данных масштабируемость методов FS оказывается под угрозой. Таким образом, существующие алгоритмы DR не решают проблемы, связанные с динамическими данными. Использование методов FS не только снижает нагрузку, связанную с обработкой данных, но и помогает предотвратить переобучение модели.
1
Динамические быстро растущие наборы данных могут содержать значительный шум, а увеличение их размера ставит под угрозу масштабируемость существующих методов отбора признаков.
2
Отбор признаков снижает вычислительную нагрузку на алгоритмы машинного обучения и может предотвращать переобучение за счёт удаления нерелевантных или избыточных признаков.
3
Большинство рассмотренных методов отбора признаков предназначено для статических наборов данных, а не для динамически генерируемых данных IoT и веб-приложений.
4
В статье рассматривается отбор признаков как подход к снижению размерности, отличающийся от извлечения признаков, для работы с многомерными данными.
5
Согласно обзору, существующие алгоритмы снижения размерности недостаточно учитывают проблемы, связанные с динамическими данными.

методы отбора признаков для снижения размерности данных в машинном обучении

эффективность, масштабируемость и ограничения методов отбора признаков, особенно для динамически генерируемых, зашумлённых и многомерных данных

Publication Details
Publication Date
2019-03-01
Journal
Publisher
ISSN
Access Type
Author Information
Authors
B. Venkatesh
J. Anuradha
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%