SVM-RFE: отбор и визуализация наиболее значимых признаков с использованием нелинейных ядер

SVM-RFE: selection and visualization of the most relevant features through non-linear kernels
Ferrán Reverter, Clarissa Valim, Héctor Sanz, Esteban Vegas, Josep M. Oller
2018-11-19

SVM-RFEметод главных компонент ядранелинейные ядрарекурсивное исключение признакованализ выживаемости
ВВЕДЕНИЕ: Метод опорных векторов (SVM) представляет собой мощный инструмент для анализа данных, в которых число предикторов примерно равно числу наблюдений или превышает его. Однако первоначально применение SVM для анализа биомедицинских данных было ограничено, поскольку этот метод не предназначен для оценки важности переменных-предикторов. В биомедицинских исследованиях крайне важно строить модели предсказания, основанные только на наиболее значимых переменных. В настоящее время проведена значительная работа по обеспечению оценки важности переменных в моделях SVM, однако основное внимание уделялось SVM с линейными ядрами. Предсказательная мощность SVM связана с гибкостью, обеспечиваемой использованием нелинейных ядер. Кроме того, SVM был расширен для моделирования исходов выживаемости. В данной статье алгоритм рекурсивного исключения признаков (Recursive Feature Elimination, RFE) расширяется за счет предложения трех подходов к ранжированию переменных на основе нелинейного SVM и SVM для анализа выживаемости. РЕЗУЛЬТАТЫ: Предложенные алгоритмы позволяют визуализировать каждую итерацию RFE и тем самым выявлять предикторы, наиболее значимые для переменной отклика. С использованием имитационных исследований, основанных на исходах «время до события», и трех реальных наборов данных мы оценили три метода, основанных на псевдовыборках и ядерном анализе главных компонент, и сравнили их с исходным алгоритмом SVM-RFE для нелинейных ядер. В имитационных исследованиях три предложенных алгоритма в целом превосходили эталонный RFE для нелинейных ядер при сравнении действительно наиболее значимых переменных с рангами переменных, полученными каждым алгоритмом. В целом метод RFE-псевдовыборок превосходил три других метода, даже когда во всех протестированных сценариях предполагалась корреляция между переменными. ВЫВОДЫ: Предложенные подходы можно точно применять для отбора переменных и оценки направления и силы связей при анализе биомедицинских данных с использованием SVM для категориальных исходов или исходов «время до события». Проведение отбора переменных...
1
В симуляциях и на трех реальных наборах данных предложенные методы в целом точнее ранжировали действительно значимые переменные, чем стандартный SVM-RFE с нелинейным ядром.
2
Метод RFE на псевдовыборках в целом превосходил остальные исследованные методы, включая сценарии с коррелированными предикторами.
3
Предложенные подходы обеспечивают точный отбор переменных в биомедицинских исследованиях с категориальными исходами или исходами типа «время до события».
4
В работе алгоритм рекурсивного исключения признаков расширен для ранжирования предикторов с использованием SVM с нелинейными ядрами и моделей SVM для анализа выживаемости.
5
Три предложенных подхода визуализируют каждую итерацию RFE, позволяя выявлять релевантные предикторы и оценивать направление и силу их связи с исходом.

Модели SVM для биомедицинских данных с категориальными исходами или исходами типа «время до события»

Отбор, ранжирование и визуализация переменных-предикторов, а также оценка направления и силы их связей с использованием рекурсивного исключения признаков, нелинейных ядер и SVM для анализа выживаемости

Publication Details
Publication Date
2018-11-19
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Ferrán Reverter
Clarissa Valim
Héctor Sanz
Esteban Vegas
Josep M. Oller
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%