Введение в интеллектуальный анализ данных

Introduction to Data Mining
2008-06-20

Обнаружение аномалий (статистические, на основе плотности, на основе близости)Анализ ассоциаций (поиск частых множеств, FP-Growth)Классификация (деревья решений, SVM, ANN, ансамблевые методы)Кластерный анализ (k-means, DBSCAN, иерархическая кластеризация)Интеллектуальный анализ данных
Эта книга представляет собой всестороннее введение в интеллектуальный анализ данных (data mining). Она охватывает базовые темы и практические методы, организованные по главам следующим образом: Глава 1 вводит понятие интеллектуального анализа данных, мотивирующие задачи, истоки, задачи анализа, область и организацию книги, библиографические примечания и упражнения. Глава 2 рассматривает данные: типы данных, качество данных, предварительную обработку данных, меры сходства и различия, библиографические примечания и упражнения. Глава 3 посвящена исследованию данных на примере набора данных Iris, сводной статистике, визуализации, OLAP и многомерному анализу данных, библиографическим примечаниям и упражнениям. Главы 4 и 5 посвящены задачам классификации: в Главе 4 изложены базовые концепции, деревья решений, переобучение моделей, оценка и сравнение классификаторов, библиографические примечания и упражнения; в Главе 5 рассматриваются альтернативные методы классификации, включая правило-ориентированные классификаторы, классификаторы ближайших соседей, байесовские классификаторы, искусственные нейронные сети, опорные векторные машины, ансамблевые методы, проблему несбалансированности классов и задачи множественной классификации, библиографические примечания и упражнения. Главы 6 и 7 посвящены анализу ассоциаций: в Главе 6 рассматриваются базовые понятия и алгоритмы — формулировка задачи, генерация частых наборов элементов, генерация правил, компактные представления частых наборов, альтернативные методы генерации, алгоритм FP-Growth, оценка шаблонов ассоциаций, влияние скошенного распределения поддержки, библиографические примечания и упражнения; в Главе 7 обсуждаются продвинутые концепции: обработка категориальных и непрерывных атрибутов, иерархии концепций, последовательные шаблоны, шаблоны-подграфы, редкие шаблоны, библиографические примечания и упражнения. Главы 8 и 9 посвящены кластерному анализу: Глава 8 излагает базовые концепции и алгоритмы, включая k-means, агломеративную иерархическую кластеризацию, DBSCAN, оценку кластеров, библиографические примечания и упражнения; Глава 9 рассматривает дополнительные вопросы и алгоритмы — характеристики данных и кластеров, прототипно-ориентированную кластеризацию, кластеризацию на основе плотности, графо-ориентированную кластеризацию, масштабируемые алгоритмы и рекомендации по выбору алгоритма, библиографические примечания и упражнения. Глава 10 посвящена обнаружению аномалий: предварительные сведения, статистические подходы, обнаружение выбросов на основе близости, на основе плотности и методы на основе кластеризации, библиографические примечания и упражнения. В приложениях приведены материалы по линейной алгебре, уменьшению размерности, теории вероятностей и статистике, регрессии и оптимизации. Книга завершается указателями авторов и предметным указателем.
1
Продвинутые темы ассоциаций включают обработку категориальных/непрерывных атрибутов, иерархии понятий, последовательные/подграфовые/редкие шаблоны.
2
Альтернативные методы классификации включают правила, ближайших соседей, байесовские методы, ИНС, SVM, ансамбли, проблемы несбалансированности и многоклассовости.
3
Обнаружение аномалий рассматривает статистические, приближенные (proximity), плотностные и кластерные методы обнаружения выбросов.
4
В приложениях представлены математические основы: линейная алгебра, уменьшение размерности, теория вероятностей/статистика, регрессия и оптимизация.
5
Анализ ассоциаций охватывает генерацию частых наборов, генерацию правил, компактные представления, FP-Growth и оценку шаблонов.
6
Раздел о классификации охватывает деревья решений, переобучение, оценку моделей и методы сравнения классификаторов.
7
Анализ кластеров рассматривает K-means, иерархическую агломеративную кластеризацию, DBSCAN, оценку кластеров и дополнительные алгоритмы (плотностные, графовые, масштабируемые).
8
Включено всестороннее изложение типов данных, качества данных, предобработки и мер похожести/расстояния для подготовки данных.
9
Методы исследования данных включают сводную статистику, визуализацию, OLAP и пример с набором данных Iris.
10
Текст определяет добычу данных, мотивирующие задачи, происхождение, задачи, объем и структуру как базовый контекст.

Дата-майнинг как область исследований (методы и задачи извлечения знаний из данных)

Базовые концепции, методы и оценка задач дата-майнинга, включая типы данных и предобработку, классификацию, ассоциативный анализ, кластеризацию, обнаружение аномалий и связанные метрики и алгоритмы

Publication Details
Publication Date
2008-06-20
Journal
Publisher
ISSN
Access Type
Author Information
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%