数据清洗步骤

数据清洗可以通过5步做好:

1.把所有非数值变量转为数值变量含有人类知识的变量根据先验知识转化(比如日期转化为天数、年、月、日等,地理转化为经纬度、城市等级等,定序变量保留序数),不含有先验知识的非数值变量通过one-hot encoding一律转成0-1哑变量,此时所有变量都是数值型的了。

2.把一系列相似变量可以用统计量概括或补充(比如不同时期第三方信息、几个城市等用均值方差之类的信息)。

3.删掉那些空值与同一值占比过多的稀疏变量。

4.删掉共线变量 。

5.把空值填充好(中位数或平均数等),然后标准化。

阅读更多
个人分类: other
想对作者说点什么? 我来说一句

数据清洗方法和策略

2007年10月20日 111KB 下载

没有更多推荐了,返回首页

不良信息举报

数据清洗步骤

最多只允许输入30个字

加入CSDN,享受更精准的内容推荐,与500万程序员共同成长!
关闭
关闭