卡方检验、相关系数、协方差系数和数据标准化

最新推荐文章于 2024-07-25 09:48:00 发布

数据臭皮匠

最新推荐文章于 2024-07-25 09:48:00 发布

阅读量2.4k

点赞数

文章标签：数学大数据 python

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_41050939/article/details/115224221

版权

概述

本篇文章为《数据挖掘概念与技术》第三章的整理和代码补充, 主题为数据预处理, 在书中多次提到在数据库中的数据预处理, 根据笔者的理解, 本章提到的数据预处理更多的存在数据挖掘的准备阶段, 在实际的工作场景中, ETL的工作是将数据原封不动的插入表中, 不会改变数据情况, 只有运用数据做数据分析,数据挖掘的时候才会做相应的处理操作。

获取第三章的思维导图文件, jupyter代码文件和数据集可以在我们的公众号"数据臭皮匠" 中回复"第三章1" 获取

1.数据清理

缺失值处理

处理缺失值得几种方法,了解下就好,深究也没意思,需要在建模的过程中逐步体会每一种方法的优缺点,换了缺失值的处理方法,可能对预测结果也没啥影响，也可能影响很大，需要一点点提升模型精度的时候可以逐个试下，上图中的处理方法从上到下越来越靠谱，但实现起来也愈加麻烦。

噪声数据处理

噪声处理，我觉得回归的方法用的最少，分箱在建立逻辑回归时用的很多，离群点分析显得不够成体系，明显的数据错误会处理下，更隐蔽的异常值需要在遇到的时候再处理

2.数据集成冗余和相关分析

卡方检验

import pandas as pd

df = pd.DataFrame([[250,200],[50,1000]],columns=['男','女'],index=['小说','非小说'])

df

def cal_Chi_Squared_val(df):

"""从列联表计算出卡方值"""

res = []

# 计算values的和

num_sum = sum(df.values.flatten())

for i in range(df.shape[0]):

for j in range(df.shape[1]):

# 计算位置i,j上的期望值

e = sum(df.iloc[i,:])*sum(df.iloc[:,j])/num_sum

tt = (df.iloc[i,j]-e)**2/e

res.append(tt)

return sum(res)

#

最低0.47元/天解锁文章

数据臭皮匠

关注

0
点赞
踩
3

收藏

觉得还不错? 一键收藏
0
评论
卡方检验、相关系数、协方差系数和数据标准化

概述本篇文章为《数据挖掘概念与技术》第三章的整理和代码补充, 主题为数据预处理, 在书中多次提到在数据库中的数据预处理, 根据笔者的理解, 本章提到的数据预处理更多的存在数据挖掘的准备阶段, 在实际的工作场景中, ETL的工作是将数据原封不动的插入表中, 不会改变数据情况, 只有运用数据做数据分析,数据挖掘的时候才会做相应的处理操作。获取第三章的思维导图文件, jupyter代码文件和数据集可以在我们的公众号"数据臭皮匠" 中回复"第三章1" 获取1.数据清理缺失值处理...
复制链接

扫一扫

数据臭皮匠 CSDN认证博客专家 CSDN认证企业博客

码龄7年

15: 原创

53万+: 周排名

147万+: 总排名

3万+: 访问

: 等级

395: 积分

28: 粉丝

36: 获赞

11: 评论

317: 收藏

私信

关注

最新评论

Q-Q图原理详解及Python实现
weixin_42160355: 不一定能在y=x上吧，分位数取决于原始数据的数值，如果两组数据量纲不同的话，就不能形成y=x，应该是能形成直线
机器学习|FP-Growth
weixin_43518213: 加油博主，技术在进步，你也在进步！
【工具篇】python pip安装第三方库
kong25849: 让升级pip咋整，就是无法用指令升级
Python安装教程之anaconda篇
kong25849: 然后呢，这个东西咋用
Python安装教程之anaconda篇
TiAmo542: jupyter创建新文件的时候一直报错，Unexpected error while saving file: Untitled.ipynb database is locked 怎么回事呢

最新文章

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。