云计算第六课时

——第六课时

大数据的表现形态:
①多元性
②实时性
③不确定性

应用领域分别为:
①个人生活
②企业
③政府部门

数据科学和大数据技术:

数据科学
大数据技术→关键性技术
大数据人才:
⑴分析技术
⑵预处理技术
⑶数据存储
⑷数据计算

数据采集:
⑴系统日志采集
⑵网络数据采集
⑶数据库采集

评估:完整性,一致性,准确性,及时性。
影响因素:信息因素,技术因素,管理因素,流程因素。

数据清洗:
——脏数据
残缺数据→处理:忽略整个元组,填写残缺值,人工填写。
噪声数据→处理:
1.等深分箱法,等宽分箱法,用户自定义分箱法。
2.平滑处理:按平均值,按中值,按边界值。
3.聚类:将数据集合为若干个簇,在簇外就是孤点,这些孤点就是噪声数据。
4.回归:通过数据构造回归函数使其回归。
冗余数据→处理:重复过滤,条件过滤。

数据转换。属性:类型变化:使用数据概论与属性构造。(一对一映射,多对一映射。)

数据集成:
模式匹配与数据值冲突
数据冗余

数据归约:
——维归约
所谓维归约,就是要减少数据的特征数目,摒弃掉不重要的特征,尽量只用少数的关键特征来描述数据。人们总是希望看到的现象主要是由少数的关键特征造成的,找到这些关键特征也是数据分析的目的。
——数值归约
数值规约通过选择替代的、较少的数据来减少数据量,包括有参数方法和无参数方法。

1、有参数方法。使用一个模型来评估数据,只需存放参数,而不需要存放实际数据,如回归。

2、无参数方法。需要存放实际数据。

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值