实例说明:pandas库中get_dummies()方法的用法

1、方法

pandas.get_dummies(data, prefix=None, prefix_sep=’_’, dummy_na=False, columns=None, sparse=False, drop_first=False)[source]

参数说明:
data : array-like, Series, or DataFrame 输入的数据
prefix : string, list of strings, or dict of strings, default None。get_dummies转换后,列名的前缀
columns : list-like, default None。指定需要实现类别转换的列名
dummy_na : bool, default False,增加一列表示空缺值,如果False就忽略空缺值
drop_first : bool, default False,获得k中的k-1个类别值,去除第一个。

2、实例解释

import setuptools
import pandas as pd
data1 = {'color':['red','blue','green'],'class':['A','B','C']}
df_data = pd.DataFrame(data1)
print(df_data)
d_data = pd.get_dummies(df_data)
print(d_data)

get_dummies 前:
在这里插入图片描述
get_dummies 后:
在这里插入图片描述
3、注意事项
当Series里存在整数时,使用get_dummies按照one-hot进行编码,但是在DataFrame里面存在整数时不会
举例说明

import setuptools
import pandas as pd

data1 = {'A':['a','b','a'],'B':['b','a','a'],'C':[1,2,3]}
df_data = pd.DataFrame(data1)
print(df_data)
d_data = pd.get_dummies(df_data)
print(d_data)
import setuptools
import pandas as pd

data1 = pd.Series([1,2,3])
print(data1)
d_data1 = pd.get_dummies(data1)
print(d_data1)

(这里数字列进行了编码)
4、总结
独热编码实际就是把列中的值拿出来当成列名。
当分类特征是离散的,无序的时(如性别有男、女,城市有北京,上海,深圳等),采用独热编码对数据进行处理。

哑变量:也叫虚拟变量,引入哑变量的目的是,将不能够定量处理的变量量化。如季节对某些产品(如冷饮)销售的影响等等。 这种“量化”通常是通过引入“哑变量”来完成的。
哑变量处理
一些分类变量,例如季节、天气、月份。要在我们的模型中包含这些数据,需要用 pandas 库中的 get_dummies()进行处理。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值