机器学习：数据预处理之独热编码（One-Hot）

最新推荐文章于 2024-03-14 10:15:25 发布

区块链专家

最新推荐文章于 2024-03-14 10:15:25 发布

阅读量728

点赞数

分类专栏： java python

原文链接：http://www.snmky.org/lszx/

版权

java 同时被 2 个专栏收录

52 篇文章 2 订阅

订阅专栏

33 篇文章 6 订阅

订阅专栏

前言
在机器学习算法中，我们经常会遇到分类特征，例如：人的性别有男女，祖国有中国，美国，法国等。
这些特征值并不是连续的，而是离散的，无序的。通常我们需要对其进行特征数字化。

那什么是特征数字化呢？例子如下：

性别特征：[“男”，“女”]

祖国特征：[“中国”，"美国，“法国”]

运动特征：[“足球直播”，“篮球”，“羽毛球”，“乒乓球”]

假如某个样本（某个人），他的特征是这样的[“男”,“中国”,“乒乓球”]，我们可以用 [0,0,4] 来表示，但是这样的特征处理并不能直接放入机器学习算法中。因为类别之间是无序的（运动数据就是任意排序的）。

什么是独热编码（One-Hot）？
One-Hot编码，又称为一位有效编码，主要是采用N位状态寄存器来对N个状态进行编码，每个状态都由他独立的寄存器位，并且在任意时候只有一位有效。

One-Hot编码是分类变量作为二进制向量的表示。这首先要求将分类值映射到整数值。然后，每个整数值被表示为二进制向量，除了整数的索引之外，它都是零值，它被标记为1。

One-Hot实际案例
就拿上面的例子来说吧，性别特征：[“男”,“女”]，按照N位状态寄存器来对N个状态进行编码的原理，咱们处理后应该是这样的（这里只有两个特征，所以N=2）：

男 => 10

女 => 01

祖国特征：[“中国”，"美国，“法国”]（这里N=3）：

中国 => 100

美国 => 010

法国 => 001

运动特征：[“足球”，“篮球”，“羽毛球”，“乒乓球”]（这里N=4）：

足球 => 1000

篮球 => 0100

羽毛球 => 0010

乒乓球 => 0001

所以，当一个样本为[“男”,“中国”,“乒乓球”]的时候，完整的特征数字化的结果为：

[1，0，1，0，0，0，0，0，1]

One-Hot在python中的使用
复制代码
from sklearn import preprocessing

enc = preprocessing.OneHotEncoder()
enc.fit([[0,0,3],[1,1,0],[0,2,1],[1,0,2]]) #这里一共有4个数据，3种特征

array = enc.transform([[0,1,3]]).toarray() #这里使用一个新的数据来测试

print array # [[ 1 0 0 1 0 0 0 0 1]]
复制代码
结果为 1 0 0 1 0 0 0 0 1
来源：http://www.snmky.org/lszx/

区块链专家

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
机器学习：数据预处理之独热编码（One-Hot）

前言在机器学习算法中，我们经常会遇到分类特征，例如：人的性别有男女，祖国有中国，美国，法国等。这些特征值并不是连续的，而是离散的，无序的。通常我们需要对其进行特征数字化。那什么是特征数字化呢？例子如下：性别特征：[“男”，“女”]祖国特征：[“中国”，"美国，“法国”]运动特征：[“足球直播”，“篮球”，“羽毛球”，“乒乓球”]假如某个样本（某个人），他的特征是这样的[“男”,“中国”,“乒乓球”]，我们可以用 [0,0,4] 来表示，但是这样的特征处理并不能直接放入机器学习算法中。因为类别之
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。