——第六课时
大数据的表现形态:
①多元性
②实时性
③不确定性
应用领域分别为:
①个人生活
②企业
③政府部门
数据科学和大数据技术:
数据科学
大数据技术→关键性技术
大数据人才:
⑴分析技术
⑵预处理技术
⑶数据存储
⑷数据计算
数据采集:
⑴系统日志采集
⑵网络数据采集
⑶数据库采集
评估:完整性,一致性,准确性,及时性。
影响因素:信息因素,技术因素,管理因素,流程因素。
数据清洗:
——脏数据
残缺数据→处理:忽略整个元组,填写残缺值,人工填写。
噪声数据→处理:
1.等深分箱法,等宽分箱法,用户自定义分箱法。
2.平滑处理:按平均值,按中值,按边界值。
3.聚类:将数据集合为若干个簇,在簇外就是孤点,这些孤点就是噪声数据。
4.回归:通过数据构造回归函数使其回归。
冗余数据→处理:重复过滤,条件过滤。
数据转换。属性:类型变化:使用数据概论与属性构造。(一对一映射,多对一映射。)
数据集成:
模式匹配与数据值冲突
数据冗余
数据归约:
——维归约
所谓维归约,就是要减少数据的特征数目,摒弃掉不重要的特征,尽量只用少数的关键特征来描述数据。人们总是希望看到的现象主要是由少数的关键特征造成的,找到这些关键特征也是数据分析的目的。
——数值归约
数值规约通过选择替代的、较少的数据来减少数据量,包括有参数方法和无参数方法。
1、有参数方法。使用一个模型来评估数据,只需存放参数,而不需要存放实际数据,如回归。
2、无参数方法。需要存放实际数据。