实例说明：pandas库中get_dummies()方法的用法

最新推荐文章于 2024-08-04 20:22:13 发布

Guo_Shi_Wu_Shuang+

最新推荐文章于 2024-08-04 20:22:13 发布

阅读量4.2k

点赞数 2

文章标签： python

本文链接：https://blog.csdn.net/mayang2015/article/details/108774292

版权

1、方法

pandas.get_dummies(data, prefix=None, prefix_sep=’_’, dummy_na=False, columns=None, sparse=False, drop_first=False)[source]

参数说明：
data : array-like, Series, or DataFrame 输入的数据
prefix : string, list of strings, or dict of strings, default None。get_dummies转换后，列名的前缀
columns : list-like, default None。指定需要实现类别转换的列名
dummy_na : bool, default False，增加一列表示空缺值，如果False就忽略空缺值
drop_first : bool, default False，获得k中的k-1个类别值，去除第一个。

2、实例解释

import setuptools
import pandas as pd
data1 = {'color':['red','blue','green'],'class':['A','B','C']}
df_data = pd.DataFrame(data1)
print(df_data)
d_data = pd.get_dummies(df_data)
print(d_data)

get_dummies 前：
在这里插入图片描述
get_dummies 后：

3、注意事项
当Series里存在整数时，使用get_dummies按照one-hot进行编码，但是在DataFrame里面存在整数时不会
举例说明

import setuptools
import pandas as pd

data1 = {'A':['a','b','a'],'B':['b','a','a'],'C':[1,2,3]}
df_data = pd.DataFrame(data1)
print(df_data)
d_data = pd.get_dummies(df_data)
print(d_data)

import setuptools
import pandas as pd

data1 = pd.Series([1,2,3])
print(data1)
d_data1 = pd.get_dummies(data1)
print(d_data1)

(这里数字列进行了编码)
4、总结
独热编码实际就是把列中的值拿出来当成列名。
当分类特征是离散的，无序的时(如性别有男、女，城市有北京，上海，深圳等)，采用独热编码对数据进行处理。

哑变量：也叫虚拟变量，引入哑变量的目的是，将不能够定量处理的变量量化。如季节对某些产品（如冷饮）销售的影响等等。这种“量化”通常是通过引入“哑变量”来完成的。
哑变量处理
一些分类变量，例如季节、天气、月份。要在我们的模型中包含这些数据，需要用 pandas 库中的 get_dummies()进行处理。