主要是整理自己在数据挖掘课程上所做的一些笔记。
更多内容可以访问我的个人博客。
数据挖掘介绍(intro)
- 历史
从数据中人工提取模式: Bayes理论(1700s) 回归分析(1800s)
- 为什么进行数据挖掘
(1)已获得的大量数据往往是数据丰富但信息贫乏的
(2)计算设备变得廉价且功能强大
(3)没有强大的工具的话,数据量已经超过人类的理解能力
(4)数据收集存储的速度越来越快
(5)传统技术已经不适用于原始数据
(6)数据挖掘有助于科学研究
- 什么是数据挖掘
(1)定义:对大量数据进行自动或半自动的探索和分析,以发现有意义的模式。
(2)数据挖掘是知识发现的一个步骤
- 什么样的数据可以被挖掘
(1)关系型数据库数据
(2)数据仓库
(3)事务(transaction)数据 每一个记录(事务transaction)包含一组项集(items)
(4)时间-空间数据
(5)图以及网状数据(超链接图、社会和信息网络)
(6)超文本和多媒体数据(文本、图像、视频和音频数据)
(7)时间相关序列数据
(8)数据流(监控、传感器)
- 可以挖掘出什么样的模式
(1)类别/概念描述:特征和区分
(2)挖掘频繁模式(频繁模式通常是指经常出现在事务性数据集中的一组项,挖掘频繁模式可以发现数据中有趣的关联和相关性)、关联关系
(3)使用分类和回归(找到一个描述和区分数据类或概念的模型)进行预测分析
(4)聚类分析
(5)异常分析(离群点分析)
- 挖掘结果的意义
(1)可能会找到许多无意义的模式
(2)什么叫有意义的模式?:有效性、新的(对系统来说是未知的)、有用的(可以对项集采取动作的)