分箱计数--减少数据稀疏度

分箱逻辑:

1.类别型特征:

  • 1)类别数在5个以下,可以直接根据类别来分箱 (binning_cate)
  • 2)类别数在5个以上,建议做降基处理,再根据降基后的类别做分箱

2.数值型特征:

  • 1)离散型数值特征(特征value的变动幅度较小):
    若特征value的非重复计数在5个以下,可以直接根据非重复计数值来分箱(binning_cate)
    若特征value的非重复计数在5个以上,建议根据业务解释或者数据分布做自定义分箱(binning_self)
  • 2)连续型数值特征(特征value的变动幅度较大):
    可以用卡方分箱或自定义分箱。(binning_num,binning_self)
    PS:一些特征用卡方分可能会报错,建议这些特征改为手动自定义分箱

3.缺失型特征:

  • 1)缺失率在5%以下,可以先对缺失做填充处理再分箱(binning_num)
  • 2)缺失率在5%以上,建议将缺失当作一个类别来分箱(binning_sparse_col)

4.稀疏型特征分箱

  • 建议将稀疏值(一般为0)单独分为一箱,剩下的值做卡方或者自定义分箱(binning_sparse_col)
离散的优势:
  • (1)离散化后的特征对异常数据有很强的鲁棒性:比如一个特征是年龄>30是1,否则0。如果特征没有离散化,一个异常数据“年龄300岁”会给模型造成很大的干扰;
  • (2)逻辑回归属于广义线性模型,表达能力受限,单变量离散化为N个后,每个变量有单独的权重,相当于为模型引入了非线性,能够提升模型表达能力,加大拟合;
  • (3)离散化后可以进行特征交叉,由M+N个变量变为M*N个变量,进一步引入非线性,提升表达能力;
  • (4)可以将缺失作为独立的一类带入模型;
  • (5)将所有变量变换到相似的尺度上。
分箱方法

        关于变量分箱主要分为两大类:有监督型和无监督型

  • 无监督:(1) 等宽 (2) 等频 (3) 聚类
  • 有监督:
  • 0
    点赞
  • 6
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值