sklearn 相关性分析_分类数据与分类数据的相关关系分析

本文详细介绍了如何使用sklearn库进行分类数据的相关性分析,包括列联表分析、相关性检验(如McNemar检验)、一致性检验(kappa检验)以及逻辑回归的应用。通过实例展示了如何进行卡方统计量计算、相关系数评估,以及在不同情况下选择合适的检验方法。
摘要由CSDN通过智能技术生成

一、列联表分析(独立性检验,非参数检验)

列联表是两个和两个以上变量的交叉分类汇总表,根据变量个数分为1维,2维,3维, ... ,1维即频数分布表。下图为2x2列表。

6a4c1b60568a13fa90d38ad7a08b8a7a.png

列联表分析分为3步:

1)建表;

2)对变量之间的相关性进行检验,通常利用卡方统计量进行检验。

d1112fa496bc098910b18ca7a7c6dbb8.png

卡方独立性检验需要满足的条件:

  • 交叉表中的值应该是频数,而不是相对频率(所占百分比)
  • 每个分类变量的各个类别是互斥的
  • 每一个观测值只属于交叉表中的一个单元格
  • 变量中的各个类别是互相独立的
  • 所有期望频数应该大于5,样本总量大于40

3)计算相关系数

40d31b7352a4a282a263bd58abd215b7.png

Example: 检验满意度与学历的相关关系。

4e80d9daf05c0e16d98070d7445c3cb2.png

1) H0假设:学历与满意度无关系.

2) 计算卡方统计量

在Python中,进行多变量相关性分析时,可以使用多元线性回归模型来分析一个因变量与多个自变量之间的关系。可以使用statsmodels或scikit-learn库来拟合多元线性回归模型。 以下是一个示例代码,展示如何使用statsmodels库进行多元线性回归分析: ```python import pandas as pd import statsmodels.api as sm # 读取数据 data = pd.read_csv('data_file.csv') # 将自变量和因变量分别存储在X和y中 X = data[['var1', 'var2', 'var3']] y = data['target'] # 向自变量添加截距项 X = sm.add_constant(X) # 拟合多元线性回归模型 model = sm.OLS(y, X).fit() # 打印模型摘要 print(model.summary()) ``` 在上面的代码中,我们首先读取数据,将自变量和因变量分别存储在X和y中。然后,我们使用`sm.add_constant()`函数向自变量添加截距项,接着使用`sm.OLS()`函数拟合多元线性回归模型。最后,我们打印模型摘要,其中包含模型参数的统计信息和显著性检验的结果。 另外,如果想使用scikit-learn库进行多元线性回归分析,可以使用LinearRegression类,示例如下: ```python import pandas as pd from sklearn.linear_model import LinearRegression # 读取数据 data = pd.read_csv('data_file.csv') # 将自变量和因变量分别存储在X和y中 X = data[['var1', 'var2', 'var3']] y = data['target'] # 拟合多元线性回归模型 model = LinearRegression().fit(X, y) # 打印模型参数 print('intercept:', model.intercept_) print('coefficients:', model.coef_) print('R-squared:', model.score(X, y)) ``` 在上面的代码中,我们同样首先读取数据,将自变量和因变量分别存储在X和y中。然后,我们使用LinearRegression类拟合多元线性回归模型,并打印模型参数以及$R^2$值。 注意,无论使用statsmodels还是scikit-learn库进行多元线性回归分析,都需要满足线性回归模型的假设,如线性、独立、正态性、同方差性等。如果数据不符合这些假设,可能会影响模型的准确性和可靠性。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值