Оценка определённого размера выборки в приложениях машинного обучения

Evaluation of a decided sample size in machine learning applications
Daniyal Rajput, Wei-Jen Wang, Chun‐Chuan Chen
2023-02-14

точность классификацииразмер эффектамашинное обучениеопределение размера выборкидесятикратная кросс-валидация
Обоснование: Подходящий размер выборки необходим для получения точных и надёжных результатов исследования. В машинном обучении (ML) исследования с недостаточным размером выборки подвержены переобучению данных и имеют меньшую вероятность выявления истинных эффектов, тогда как увеличение размера выборки повышает точность прогнозирования, но после достижения определённого размера может уже не приводить к значимым изменениям. Существующие статистические подходы к определению размера выборки, использующие стандартизированную разницу средних, размер эффекта и статистическую мощность, могут быть смещены из-за ошибок расчёта или недостатка экспериментальных сведений. Целью данного исследования было разработать критерии оценки размера выборки в исследованиях машинного обучения. Для выработки критериев размера выборки мы изучили средние и совокупные размеры эффекта, а также эффективность пяти методов машинного обучения с использованием смоделированных наборов данных и трёх реальных наборов данных. Мы систематически увеличивали размер выборки, начиная с 16 наблюдений, посредством случайной выборки и оценивали влияние размера выборки на эффективность классификаторов и оба показателя размера эффекта. Для количественной оценки точности применяли десятикратную перекрёстную проверку. Результаты: Результаты показали, что при хорошей дискриминирующей способности наборов данных между двумя классами размеры эффекта и точность классификации увеличивались с ростом размера выборки, тогда как дисперсия размеров эффекта уменьшалась. Напротив, неопределённые наборы данных характеризовались низкими размерами эффекта и точностью классификации, которые не улучшались при увеличении размера выборки ни в смоделированных, ни в реальных данных. Для хорошего набора данных наблюдалось значимое различие между средним и совокупным размерами эффекта. На основании этих результатов мы вывели два критерия оценки определённого размера выборки, объединяющие размер эффекта и точность ML. Размер выборки считался подходящим, если он обеспечивал приемлемые размеры эффекта (≥ 0,5) и точность ML (≥ 80%). После достижения подходящего размера выборки дальнейшее увеличение числа наблюдений не приносило пользы, поскольку не приводило к значимому изменению размера эффекта или точности, что в итоге приводило к...
1
Подходящий размер выборки определяется совместно размером эффекта и эффективностью машинного обучения: размер эффекта должен быть не менее 0,5, а точность — не менее 80%.
2
После достижения подходящего размера выборки добавление наблюдений не приводит к значимому улучшению размера эффекта или точности классификации.
3
Для неопределённых наборов данных размеры эффекта и точность классификации остаются низкими и не улучшаются при увеличении выборки.
4
Исследование разрабатывает критерии оценки достаточности выборки в задачах машинного обучения на основе размеров эффекта и точности классификации.
5
Для наборов данных с хорошим различением классов увеличение размера выборки повышает размеры эффекта и точность классификации, одновременно уменьшая дисперсию размера эффекта.

Размер выборки в исследованиях машинного обучения, оцениваемый с использованием смоделированных и реальных наборов данных с задачами бинарной классификации

Взаимосвязь между размером выборки, величинами эффекта и точностью классификации методами машинного обучения, включая критерии определения адекватного размера выборки

Publication Details
Publication Date
2023-02-14
Journal
Publisher
ISSN
Cited by
406
Access Type
Author Information
Authors
Daniyal Rajput
Wei-Jen Wang
Chun‐Chuan Chen
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%