分组分析方法与实现

分组分析,是指将客体(问卷、特征、现实)按研究要求进行分类编组,使得同组客体之间的差别小于各种客体之间的差别,进而进行分析研究的方法。其特点在于不依赖于原始资料分布的正常性假设,可以按任意规律分布,在分析既包括数量资料,又包括质量资料的混合资料时尤为重要。

离散属性的分组比较容易,而连续属性的分组,分组前要进行离散化

img_89bc0985aa861e2dfbd5fa8c8a9959d0.png

img_6fc5138c7dabcd6cb90c5c67570b9c74.png

img_20111b886fdcc7088dfa85dd298622ce.png
image.png

img_71a70bb08db5d322913e8535bdeae4e5.png
离散值基尼系数的计算

img_1d84c09be39a4ad3ba21f1de2f4cb8e8.png
连续值的基尼系数的计算




代码实现
import pandas as pd
import seaborn as sns
import matplotlib.pyplot as plt
sns.set_context(font_scale=1.5)
df = pd.read_csv("./data/HR.csv")
sns.barplot(x="salary",y="left",hue="department",data=df)
plt.show()
img_d74a76e29b226b5fc91a8a5b65c2e64e.png
未去除异常值,因此图像比较模糊
sl_s = df["satisfaction_level"]
sl_s = sl_s.dropna()
sns.barplot(list(range(len(sl_s))),sl_s.sort_values())
plt.show()
img_c93ba53816212ffe8b9a53d65aac602b.png
图中有两个明显的拐弯的界限,可以根据界限来对满意度分组
  • 0
    点赞
  • 2
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值