数据挖掘笔记(一)

主要是整理自己在数据挖掘课程上所做的一些笔记。
更多内容可以访问我的个人博客

  1. 数据挖掘介绍

  2. 数据探索


数据挖掘介绍(intro)

  • 历史

从数据中人工提取模式: Bayes理论(1700s) 回归分析(1800s)

  • 为什么进行数据挖掘

(1)已获得的大量数据往往是数据丰富但信息贫乏的
(2)计算设备变得廉价且功能强大
(3)没有强大的工具的话,数据量已经超过人类的理解能力
(4)数据收集存储的速度越来越快
(5)传统技术已经不适用于原始数据
(6)数据挖掘有助于科学研究

  • 什么是数据挖掘

(1)定义:对大量数据进行自动或半自动的探索和分析,以发现有意义的模式。
(2)数据挖掘是知识发现的一个步骤

  • 什么样的数据可以被挖掘

(1)关系型数据库数据
(2)数据仓库
(3)事务(transaction)数据 每一个记录(事务transaction)包含一组项集(items)
(4)时间-空间数据
(5)图以及网状数据(超链接图、社会和信息网络)
(6)超文本和多媒体数据(文本、图像、视频和音频数据)
(7)时间相关序列数据
(8)数据流(监控、传感器)

  • 可以挖掘出什么样的模式

(1)类别/概念描述:特征和区分
(2)挖掘频繁模式(频繁模式通常是指经常出现在事务性数据集中的一组项,挖掘频繁模式可以发现数据中有趣的关联和相关性)、关联关系
(3)使用分类和回归(找到一个描述和区分数据类或概念的模型)进行预测分析
(4)聚类分析
(5)异常分析(离群点分析)

  • 挖掘结果的意义

(1)可能会找到许多无意义的模式
(2)什么叫有意义的模式?:有效性、新的(对系统来说是未知的)、有用的(可以对项集采取动作的)、可理解的(人类能解释的)

  • 使用哪些技术

机器学习、统计、人工智能、数据库、可视化等

  • 应用
  • 5
    点赞
  • 19
    收藏
    觉得还不错? 一键收藏
  • 2
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 2
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值