Pandas之 get_dummies 进行 one-hot 编码(虚拟变量或哑变量)

一、虚拟变量概念

    虚拟变量 ( Dummy Variables) 又称虚设变量名义变量哑变量用以反映质的属性的一个人工变量,是量化了的自变量,通常取值为0或1。引入哑变量可使线形回归模型变得更复杂,但对问题描述更简明,一个方程能达到两个方程的作用,而且接近现实。

二、为什么使用虚拟变量

    在回归分析中,自变量X既可以是定量数据也可以定类数据回归分析计算时是将所有自变量X视为数字,但当数据为定类数据时,此时数字代表类别,数字大小本身没有比较意义。因此,这类数据在做回归分析时,需要设置成虚拟变量才能纳入回归分析正确分析数据。

三、使用范围

    通常情况下,回归分析,逐步回归,分层回归,Logistic回归,PLS回归等这类影响关系研究的方法时,才可能涉及到虚拟变量设置。其它分析方法并不会涉及。

四、设置原则

    在模型中引入多个虚拟变量时,虚拟变量的个数应按下列原则确定:

    (1)如果回归模型有截距项:有m种互斥的属性类型,在模型中引入(m-1)个虚拟变量。
    (2)如果回归模型无截距项,有m个特征,设置m个虚拟变量

五、举例

1、方法

pandas.get_dummies(data, prefix=None, prefix_sep='_', dummy_na=False, columns=None, sparse=False, drop_first=False)

2、参数

data : array-like, Series, or DataFrame 输入的数据
prefix : get_dummies转换后,列名的前缀
*columns :指定需要实现类别转换的列名
dummy_na : bool, default False 增加一列表示空缺值,如果False就忽略空缺值
drop_first : bool, default False 获得k中的k-1个类别值,去除第一个

3、例子

在这里插入图片描述
    没有设置虚拟变量的结果:
在这里插入图片描述
    设置了虚拟变量的结果:

在这里插入图片描述
    对指定列设置虚拟变量:
在这里插入图片描述
    对指定列设置虚拟变量后并将其结果合并到原始数据中:
在这里插入图片描述

  • 0
    点赞
  • 9
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值