Алгоритм k-means: всесторонний обзор и оценка производительности
The k-means Algorithm: A Comprehensive Survey and Performance Evaluation
2020-08-12
SCID: 54.1/wz7mxnfv
Discuss with AI
экспериментальная оценка эффективностиk-средних кластеризацияварианты k-среднихчисло кластеров (k)случайная инициализация
Figures from the paper
Abstract (AI)
Алгоритм кластеризации k-means считается одним из наиболее мощных и популярных алгоритмов интеллектуального анализа данных в научном сообществе. Однако, несмотря на свою популярность, алгоритм имеет определённые ограничения, включая проблемы, связанные со случайной инициализацией центроидов, что может приводить к непредсказуемой сходимости. Кроме того, алгоритм требует заранее задать число кластеров, что влияет на форму кластеров и чувствительность к выбросам. Фундаментальная проблема k-means — неспособность работать с различными типами данных. В статье представлен структурированный и синоптический обзор исследований, направленных на преодоление этих недостатков. Обсуждаются варианты k-means, включая недавние разработки, и их эффективность исследуется посредством экспериментального анализа на разнообразных наборах данных. Детальный экспериментальный анализ вместе с тщательным сравнением различных алгоритмов кластеризации k-means отличает нашу работу от других существующих обзорных статей. Кроме того, в статье даётся ясное и всестороннее понимание k-means и его различных направлений исследований.
Key Findings
1
Фундаментальное ограничение k-means — неспособность работать с различными типами данных (т.е. неоднородностью данных).
2
В статье рассматриваются варианты и недавние модификации k-means, направленные на преодоление этих недостатков, и обсуждается их эффективность.
3
Работа содержит детальный экспериментальный анализ и сравнительную оценку на множестве наборов данных, что отличает её от предыдущих обзоров.
4
k-means — широко используемый и мощный алгоритм кластеризации, но имеет существенные ограничения из-за случайной инициализации центроидов, вызывающей нестабильную сходимость.
5
k-means требует заранее заданного числа кластеров, что влияет на форму кластеров и чувствительность к выбросам.
Research Object
Алгоритм кластеризации k-means
Research Subject
Ограничения, варианты, последние разработки и эмпирическая оценка эффективности алгоритма k-means (включая чувствительность к инициализации, необходимость предварительного задания числа кластеров, обработку различных типов данных, форму кластеров и влияние выбросов)
Publication Details
Publication Date
2020-08-12
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest