机器学习:特征工程之数据处理

本文介绍了机器学习中数据预处理的重要步骤,包括归一化、标准化和缺失值处理。归一化是将数据映射到[0,1]区间,标准化则使数据均值为0,方差为1,减少异常值的影响。对于缺失值,可以通过删除或插补方法处理。sklearn库提供了预处理工具,如MinMaxScaler和StandardScaler进行数值缩放,以及Imputer进行缺失值填充。" 117334395,8523322,JVM对象内存分配与回收详解,"['java', 'jvm', '内存管理', '垃圾回收']
摘要由CSDN通过智能技术生成

第一部分:数据特征预处理

特征处理:通过特定的统计方法(数学方法)将数据转换成算法要求的数据。
数值型数据:标准缩放(归一化、标准化)、缺失值处理
类别型数据:one-hot编码
时间类型:时间的切分
sklearn.preprocessing模块提供了一些数据预处理API

一.归一化

1.目的
在特征(维度)非常多的时候,可以防止某一维或某几维对数据影响过大,把不同来源的数据统一到一个参考区间下,使得不同数值范围的数据变得同等重要,预测结果更有意义。
例如:一个人的身高和体重两个特征,假如体重50kg,身高175cm,由于两个单位不一样,数值大小不一样。如果比较两个人的体型差距时,那么身高的影响结果会比较大。
2.原理
通过对原始数据进行线性变换把数据映射到[min,max]之间,通常取[0,1]:
在这里插入图片描述
3.代码
1)普通归一化

def feature_normal(data_set)
    #特征归一化
    min_vals = data_set.min(0)
    max_vals = data_set.max(0)
    ranges = max_vals - min_vals
    norm_data = np.zeros(np.shape(data_set))
    # 得出行数
    m = data_set.shape[0]
    # 复制min_vals,行数乘m,再进行矩阵相减
    norm_data = data_set - np.tile(min_vals, (m,1))
    # 复制ranges,行数乘m,再进行矩阵相除
    norm_data = norm_data/np.tile(ranges, (m, 1)))
    return norm_data

2)调用sklearn.preprocessing.MinMaxScaler
MinMaxScaler(feature_range=(min,max))----每个特征缩放到给定范围(默认[0,1]);
MinMaxScaler.fit_transform(X)----返回转换后的array,X:numpy array格式的数据[n_samples,n_features]。

>>> from sklearn.preprocess
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值