Обработка пропущенных значений для портфелей машинного обучения
Missing Values Handling for Machine Learning Portfolios
2022-07-21
SCID: 54.1/g3tn6y3h
Discuss with AI
кросс-секционные предикторы доходностиожидание-максимизация (EM)импутация (поперечное среднее)портфели машинного обученияобработка пропущенных значений
Figures from the paper
Abstract (AI)
Мы характеризуем структуру и происхождение пропусков для 159 кросс-секционных предикторов доходности и изучаем методы обработки пропущенных значений для портфелей, построенных с использованием машинного обучения. Простая иммутация средними по кросс‑секции показывает хорошие результаты по сравнению с строгими методами ожидание-максимизация. Это объясняется тремя свойствами данных предикторов: (1) пропуски возникают крупными блоками, организованными по времени, (2) кросс‑секционные корреляции невелики и (3) пропуски, как правило, образуются блоками, связанными с исходным источником данных. В результате наблюдаемые данные дают мало информации о пропущенных значениях. Сложные методы иммутации вносят оценочную шумность, что может приводить к ухудшению работы, если машинное обучение применяется без должной осторожности.
Key Findings
1
Для 159 перекрестных предикторов доходности была охарактеризована структура и происхождение пропусков и проанализировано обращение с ними в портфелях на основе машинного обучения.
2
Наблюдаемые данные дают мало информации о пропущенных значениях с учётом блочной структуры пропусков и низкой поперечной корреляции.
3
Простая импутация по поперечному среднему показывает хорошую работу по сравнению с методами ожидание–максимизация для этих предикторов.
4
Сложные методы им-путации могут вносить шум оценивания, приводящий к ухудшению результатов, если машинное обучение не применяется осторожно.
5
Три свойства данных объясняют, почему простая импутация достаточна: пропуски возникают большими блоками, организованными по времени; поперечные корреляции малы; пропуски связаны с блоками по источнику данных.
Research Object
Пропущенные значения в 159 кросс-секционных предикторах доходности, используемых для построения портфелей машинным обучением
Research Subject
Эффективность различных методов обработки пропущенных значений/импутации (импутация средним по срезу, метод ожидания‑максимизации и более сложные импутации) для производительности портфелей, построенных методом машинного обучения, с учётом структуры и происхождения пропусков
Publication Details
Publication Date
2022-07-21
Journal
Publisher
ISSN
Cited by
20
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest