数据预处理之数据离散化

最新推荐文章于 2023-05-11 09:41:41 发布

lonely_square_three

最新推荐文章于 2023-05-11 09:41:41 发布

阅读量1.8w

点赞数 3

分类专栏：特征预处理文章标签：数据预处理数据离散化

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/xzfreewind/article/details/77102835

版权

特征预处理专栏收录该内容

8 篇文章 5 订阅

订阅专栏

数据离散化的意义

数据离散化是指将连续的数据进行分段，使其变为一段段离散化的区间。分段的原则有基于等距离、等频率或优化的方法。数据离散化的原因主要有以下几点：

1**.算法需要：**

比如决策树、朴素贝叶斯等算法，都是基于离散型的数据展开的。如果要使用该类算法，必须将离散型的数据进行。有效的离散化能减小算法的时间和空间开销，提高系统对样本的分类聚类能力和抗噪声能力。

2**.离散化的特征相对于连续型特征更易理解，更接近知识层面的表达**

比如工资收入，月薪2000和月薪20000，从连续型特征来看高低薪的差异还要通过数值层面才能理解，但将其转换为离散型数据（底薪、高薪），则可以更加直观的表达出了我们心中所想的高薪和底薪。

3.可以有效的克服数据中隐藏的缺陷，使模型结果更加稳定

等宽法

等宽法即是将属性值分为具有相同宽度的区间，区间的个数k根据实际情况来决定。比如属性值在[0，60]之间，最小值为0，最大值为60，我们要将其分为3等分，则区间被划分为[0,20] 、[21,40] 、[41，60]，每个属性值对应属于它的那个区间

等频法

等宽法即是将属性值分为具有相同宽度的区间，区间的个数k根据实际情况来决定。比如有60个样本，我们要将其分为k=3部分，则每部分的长度为20个样本。

基于聚类的方法

基于聚类的方法分为两个步骤，即：

1.选定聚类算法将其进行聚类

2.将在同一个簇内的属性值做为统一标记。

注：基于聚类的方法，簇的个数要根据聚类算法的实际情况来决定，比如对于k-means算法，簇的个数可以自己决定，但对于DBSCAN，则是算法找寻簇的个数。

参考

《python数据分析与挖掘实战》

lonely_square_three

关注

3
点赞
踩
21

收藏

觉得还不错? 一键收藏
0
评论
数据预处理之数据离散化

数据离散化的意义数据离散化是指将连续的数据进行分段，使其变为一段段离散化的区间。分段的原则有基于等距离、等频率或优化的方法。数据离散化的原因主要有以下几点：1**.算法需要：**比如决策树、朴素贝叶斯等算法，都是基于离散型的数据展开的。如果要使用该类算法，必须将离散型的数据进行。有效的离散化能减小算法的时间和空间开销，提高系统对样本的分类聚类能力和抗噪声能力。
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。