Обработка пропущенных значений для портфелей машинного обучения

Missing Values Handling for Machine Learning Portfolios
Andrew Y. Chen, Jack McCoy
2022-07-21

кросс-секционные предикторы доходностиожидание-максимизация (EM)импутация (поперечное среднее)портфели машинного обученияобработка пропущенных значений
Мы характеризуем структуру и происхождение пропусков для 159 кросс-секционных предикторов доходности и изучаем методы обработки пропущенных значений для портфелей, построенных с использованием машинного обучения. Простая иммутация средними по кросс‑секции показывает хорошие результаты по сравнению с строгими методами ожидание-максимизация. Это объясняется тремя свойствами данных предикторов: (1) пропуски возникают крупными блоками, организованными по времени, (2) кросс‑секционные корреляции невелики и (3) пропуски, как правило, образуются блоками, связанными с исходным источником данных. В результате наблюдаемые данные дают мало информации о пропущенных значениях. Сложные методы иммутации вносят оценочную шумность, что может приводить к ухудшению работы, если машинное обучение применяется без должной осторожности.
1
Для 159 перекрестных предикторов доходности была охарактеризована структура и происхождение пропусков и проанализировано обращение с ними в портфелях на основе машинного обучения.
2
Наблюдаемые данные дают мало информации о пропущенных значениях с учётом блочной структуры пропусков и низкой поперечной корреляции.
3
Простая импутация по поперечному среднему показывает хорошую работу по сравнению с методами ожидание–максимизация для этих предикторов.
4
Сложные методы им-путации могут вносить шум оценивания, приводящий к ухудшению результатов, если машинное обучение не применяется осторожно.
5
Три свойства данных объясняют, почему простая импутация достаточна: пропуски возникают большими блоками, организованными по времени; поперечные корреляции малы; пропуски связаны с блоками по источнику данных.

Пропущенные значения в 159 кросс-секционных предикторах доходности, используемых для построения портфелей машинным обучением

Эффективность различных методов обработки пропущенных значений/импутации (импутация средним по срезу, метод ожидания‑максимизации и более сложные импутации) для производительности портфелей, построенных методом машинного обучения, с учётом структуры и происхождения пропусков

Publication Details
Publication Date
2022-07-21
Journal
Publisher
ISSN
Cited by
20
Access Type
Author Information
Authors
Andrew Y. Chen
Jack McCoy
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%