大数据~大数据预处理整体架构（数据清洗、数据集成、数据转换、数据消减

荣光彼方

于 2024-04-28 16:47:34 发布

阅读量937

点赞数 8

分类专栏：程序员文章标签：大数据

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/tencentes/article/details/138283573

版权

这种方法尤其适合在进行分类挖掘时使用。

例如，若要对商场顾客按信用风险进行分类挖掘时，就可以用在同一信用风险类别（如良好）下的“顾客收入”属性的平均值，来填补所有在同一信用风险类别下“顾客收入”属性的遗漏值。

6）利用最可能的值填补遗漏值

可以利用回归分析、贝叶斯计算公式或决策树推断出该条记录特定属性的最大可能的取值。

例如，利用数据集中其他顾客的属性值，可以构造一个决策树来预测“顾客收入”属性的遗漏值。

最后一种方法是一种较常用的方法，与其他方法相比，它最大程度地利用了当前数据所包含的信息来帮助预测所遗漏的数据。

数据集成

数据处理常常涉及数据集成操作，即将来自多个数据源的数据，如数据库、数据立方、普通文件等，结合在一起并形成一个统一数据集合，以便为数据处理工作的顺利完成提供完整的数据基础。

在数据集成过程中，需要考虑解决以下几个问题。

模式集成问题

模式集成问题就是如何使来自多个数据源的现实世界的实体相互匹配，这其中就涉及实体识别问题。

例如，如何确定一个数据库中的“custom_id”与另一个数据库中的“custome_number”是否表示同一实体。

数据库与数据仓库通常包含元数据，这些元数据可以帮助避免在模式集成时发生错误。

冗余问题

冗余问题是数据集成中经常发生的另一个问题。若一个属性可以从其他属性中推演出来，那这个属性就是冗余属性。

例如，一个顾客数据表中的平均月收入属性就是冗余属性，显然它可以根据月收入属性计算出来，这就是俩个冗余的数据。此外，属性命名的不

最低0.47元/天解锁文章

关注

8
点赞
踩
13

收藏

觉得还不错? 一键收藏
0
评论
大数据~大数据预处理整体架构（数据清洗、数据集成、数据转换、数据消减

数据处理常常涉及数据集成操作，即将来自多个数据源的数据，如数据库、数据立方、普通文件等，结合在一起并形成一个统一数据集合，以便为数据处理工作的顺利完成提供完整的数据基础。例如，若要对商场顾客按信用风险进行分类挖掘时，就可以用在同一信用风险类别（如良好）下的“顾客收入”属性的平均值，来填补所有在同一信用风险类别下“顾客收入”属性的遗漏值。例如，街道属性可以泛化到更高层次的概念，如城市、国家，数值型的属性，如年龄属性，可以映射到更高层次的概念，如年轻、中年和老年。冗余问题是数据集成中经常发生的另一个问题。
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。