【逻辑回归】分类中解决类别不平衡问题

1. 类别不平衡数据集基本介绍

前⾯我们已经初步认识了,什么是类别不平衡问题。其实,在现实环境中,采集的数据(建模样本)往往是比例失衡
的。比如网贷数据,逾期人数的比例是极低的(千分之几的比例);奢侈品消费人群鉴定等。

在这⼀节中,我们⼀起看⼀下,当遇到数据类别不平衡的时候,我们该如何处理。在Python中,有Imblearn包,它就是为处理数据比例失衡而生的。

  • 安装Imblearn包
pip3 install imbalanced-learn

第三方包链接:https://pypi.org/project/imbalanced-learn/

  • 创造数据集
from sklearn.datasets import make_classification 
import matplotlib.pyplot as plt 
#使⽤make_classification⽣成样本数据 
X, y = make_classification(n_samples=5000, 
						   n_features=2, # 特征个数= n_informative() + n_redundant + n_repeated 
						   n_informative=2, # 多信息特征的个数 
						   n_redundant=0, # 冗余信息,informative特征的随机线性组合 
						   n_repeated=0, # 重复信息,随机提取n_informative和n_redundant 特征 
						   n_classes=3, # 分类类别 
						   n_clusters_per_class=1, # 某⼀个类别是由⼏个cluster构成的 
						   weights=[0.01, 0.05, 0.94], # 列表类型,权重⽐ 
						   random_state=0)

在这里插入图片描述

  • 查看各个标签的样本
#查看各个标签的样本量 
from collections import Counter 
Counter(y) 
# Counter({2: 4674, 1: 262, 0: 64})

在这里插入图片描述

  • 数据集可视化
# 数据可视化
plt.scatter(x[:, 0],x[:, 1], c=y)
plt.show()

在这里插入图片描述
可以看出样本的三个标签中,1,2的样本量极少,样本失衡。下面使用imblearn进行过采样。 接下来,我们就要基于以上数据,进行相应的处理。

关于类别不平衡的问题,主要有两种处理方式:

  • 过采样方法
    • 增加数量较少那⼀类样本的数量,使得正负样本比例均衡。
  • 欠采样方法
    • 减少数量较多那⼀类样本的数量,使得正负样本比例均衡。

2. 解决类别不平衡数据方法介绍

2.1 过采样方法

2.1.1 什么是过采样方法

对训练集里的少数类进行“过采样”(oversampling),即增加⼀些少数类样本使得正、反例数目接近,然后再进行学习。

2.1.2 随机过采样方法

随机过采样是在少数类中随机选择⼀些样本,然后通过复制所选择的样本生成样本集。

在这里插入图片描述

  • 通过代码实现随机过采样方法:
# 使⽤imblearn进⾏随机过采样 
from imblearn.over_sampling import RandomOverSampler 
ros = RandomOverSampler(random_state=0) 
X_resampled, y_resampled = ros.fit_resample(X, y) 
#查看结果 
Counter(y_resampled) 

#过采样后样本结果 
# Counter({2: 4674, 1: 4674, 0: 4674}) 

# 数据集可视化 
plt.scatter(X_resampled[:, 0], X_resampled[:, 1], c=y_resampled) 
plt.show()

在这里插入图片描述

  • 缺点:
    • 对于随机过采样,由于需要对少数类样本进⾏复制来扩⼤数据集,造成模型训练复杂度加大。
    • 另一方面也容易造成模型的过拟合问题,因为随机过采样是简单的对初始样本进行复制采样,这就使得机器学习学得的规则过于具体化,不利于学习器的泛化性能,造成过拟合问题。

为了解决随机过采样中造成模型过拟合问题,又能保证实现数据集均衡的目的,出现了过采样法代表性的算法SMOTE 算法。

SMOTE算法合成新少数类样本的算法描述如下:

  1. 对于少数类中的每⼀个样本,以欧式距离为标准计算它到少数类样本集中所有样本的距离,得到其k近邻。

  2. 根据样本不平衡比例设置⼀个采样比例以确定采样倍率N,对于每⼀个少数类样本,从其k近邻中随机选择若干个样本,假设选择的是。

  3. 对于每⼀个随机选出来的近邻,分别与按照如下公式构建新的样本。

在这里插入图片描述

SMOTE算法摒弃了随机过采样复制样本的做法,可以防⽌随机过采样中容易过拟合的问题,实践证明此方法可以提高分类器的性能。

  • 代码实现:
# SMOTE过采样 
from imblearn.over_sampling import SMOTE 
X_resampled, y_resampled = SMOTE().fit_resample(X, y) 
Counter(y_resampled) 

# 采样后样本结果 
# [(0, 4674), (1, 4674), (2, 4674)] 

# 数据集可视化 
plt.scatter(X_resampled[:, 0], X_resampled[:, 1], c=y_resampled) 
plt.show()

在这里插入图片描述

2.2 欠采样方法

2.2.1 什么是欠采样方法

直接对训练集中多数类样本进行“欠采样”(undersampling),即去除⼀些多数类中的样本使得正例、反例数目接近,然后再进行学习。

2.2.2 随机欠采样方法

随机欠采样顾名思义即从多数类中随机选择⼀些样样本组成样本集。

  • 代码实现:
# 随机⽋采样 
from imblearn.under_sampling import RandomUnderSampler 
rus = RandomUnderSampler(random_state=0) 
X_resampled, y_resampled = rus.fit_resample(X, y) 
Counter(y_resampled) 

# 采样后结果 
[(0, 64), (1, 64), (2, 64)] 

# 数据集可视化 
plt.scatter(X_resampled[:, 0], X_resampled[:, 1], c=y_resampled) 
plt.show()

在这里插入图片描述

  • 缺点:
    • 随机欠采样方法通过改变多数类样本比例以达到修改样本分布的目的,从而使样本分布较为均衡,但是这也存 在⼀些问题。对于随机⽋采样,由于采样的样本集合要少于原来的样本集合,因此会造成⼀些信息缺失,即将 多数类样本删除有可能会导致分类器丢失有关多数类的重要信息。

官网链接https://imbalanced-learn.readthedocs.io/en/stable/ensemble.html

加油!

感谢!

努力!

  • 2
    点赞
  • 19
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 2
    评论
1.版本:matlab2014/2019a,内含运行结果,不会运行可私信 2.领域:智能优化算法、神经网络预测、信号处理、元胞自动机、图像处理、路径规划、无人机等多种领域的Matlab仿真,更多内容可点击博主头像 3.内容:标题所示,对于介绍可点击主页搜索博客 4.适合人群:本科,硕士等教研学习使用 5.博客介绍:热爱科研的Matlab仿真开发者,修心和技术同步精进,matlab项目合作可si信 ### 1 智能优化算法及应用 **1.1 改进智能优化算法方面(单目标和多目标)** **1.2 生产调度方面** 1.2.1 装配线调度研究 1.2.2 车间调度研究 1.2.3 生产线平衡研究 1.2.4 水库梯度调度研究 **1.3 路径规划方面** 1.3.1 旅行商问题研究(TSP、TSPTW) 1.3.2 各类车辆路径规划问题研究(vrp、VRPTW、CVRP) 1.3.3 机器人路径规划问题研究 1.3.4 无人机三维路径规划问题研究 1.3.5 多式联运问题研究 1.3.6 无人机结合车辆路径配送 **1.4 三维装箱求解** **1.5 物流选址研究** 1.5.1 背包问题 1.5.2 物流选址 1.5.4 货位优化 ##### 1.6 电力系统优化研究 1.6.1 微电网优化 1.6.2 配电网系统优化 1.6.3 配电网重构 1.6.4 有序充电 1.6.5 储能双层优化调度 1.6.6 储能优化配置 ### 2 神经网络回归预测、时序预测、分类清单 **2.1 bp预测和分类** **2.2 lssvm预测和分类** **2.3 svm预测和分类** **2.4 cnn预测和分类** ##### **2.5 ELM预测**和分类 ##### **2.6 KELM预测**和分类 **2.7 ELMAN预测和分类** ##### **2.8 LSTM预测**和分类 **2.9 RBF预测和分类** ##### 2.10 DBN预测和分类 ##### 2.11 FNN预测 ##### 2.12 DELM预测和分类 ##### 2.13 BIlstm预测和分类 ##### 2.14 宽度学习预测和分类 ##### 2.15 模糊小波神经网络预测和分类 ##### 2.16 GRU预测和分类 ### 3 图像处理算法 **3.1 图像识别** 3.1.1 车牌、交通标志识别(新能源、国内外、复杂环境下车牌) 3.1.2 发票、身份证、银行卡识别 3.1.3 人脸类别和表情识别 3.1.4 打靶识别 3.1.5 字符识别(字母、数字、手写体、汉字、验证码) 3.1.6 病灶识别 3.1.7 花朵、药材、水果蔬菜识别 3.1.8 指纹、手势、虹膜识别 3.1.9 路面状态和裂缝识别 3.1.10 行为识别 3.1.11 万用表和表盘识别 3.1.12 人民币识别 3.1.13 答题卡识别 **3.2 图像分割** **3.3 图像检测** 3.3.1 显著性检测 3.3.2 缺陷检测 3.3.3 疲劳检测 3.3.4 病害检测 3.3.5 火灾检测 3.3.6 行人检测 3.3.7 水果分级 **3.4 图像隐藏** **3.5 图像去噪** **3.6 图像融合** **3.7 图像配准** **3.8 图像增强** **3.9 图像压缩** ##### 3.10 图像重建 ### 4 信号处理算法 **4.1 信号识别** **4.2 信号检测** **4.3 信号嵌入和提取** **4.4 信号去噪** ##### 4.5 故障诊断 ##### 4.6 脑电信号 ##### 4.7 心电信号 ##### 4.8 肌电信号 ### 5 元胞自动机仿真 **5.1 模拟交通流** **5.2 模拟人群疏散** **5.3 模拟病毒扩散** **5.4 模拟晶体生长** ### 6 无线传感器网络 ##### 6.1 无线传感器定位 ##### 6.2 无线传感器覆盖优化 ##### 6.3 室内定位 ##### 6.4 无线传感器通信及优化 ##### 6.5 无人机通信继优化
MLR - 多元线性回归PCA - 主成分分析PLS - 偏最小二乘LogisticR - 逻辑斯蒂回归Ganzhiji - 感知机(perception)PSO - 粒子群优化KNN - K_近邻Bay1.版本:matlab2014/2019a/2021a,内含运行结果,不会运行可私信 2.领域:智能优化算法、神经网络预测、信号处理、元胞自动机、图像处理、路径规划、无人机等多种领域的Matlab仿真,更多内容可点击博主头像 3.内容:标题所示,对于介绍可点击主页搜索博客 4.适合人群:本科,硕士等教研学习使用 5.博客介绍:热爱科研的Matlab仿真开发者,修心和技术同步精进,matlab项目合作可si信 %% 开发者:Matlab科研助手 %% 更多咨询关注天天Matlab微信公众号 ### 团队长期从事下列领域算法的研究和改进: ### 1 智能优化算法及应用 **1.1 改进智能优化算法方面(单目标和多目标)** **1.2 生产调度方面** 1.2.1 装配线调度研究 1.2.2 车间调度研究 1.2.3 生产线平衡研究 1.2.4 水库梯度调度研究 **1.3 路径规划方面** 1.3.1 旅行商问题研究(TSP、TSPTW) 1.3.2 各类车辆路径规划问题研究(vrp、VRPTW、CVRP) 1.3.3 机器人路径规划问题研究 1.3.4 无人机三维路径规划问题研究 1.3.5 多式联运问题研究 1.3.6 无人机结合车辆路径配送 **1.4 三维装箱求解** **1.5 物流选址研究** 1.5.1 背包问题 1.5.2 物流选址 1.5.4 货位优化 ##### 1.6 电力系统优化研究 1.6.1 微电网优化 1.6.2 配电网系统优化 1.6.3 配电网重构 1.6.4 有序充电 1.6.5 储能双层优化调度 1.6.6 储能优化配置 ### 2 神经网络回归预测、时序预测、分类清单 **2.1 bp预测和分类** **2.2 lssvm预测和分类** **2.3 svm预测和分类** **2.4 cnn预测和分类** ##### 2.5 ELM预测和分类 ##### 2.6 KELM预测和分类 **2.7 ELMAN预测和分类** ##### 2.8 LSTM预测和分类 **2.9 RBF预测和分类** ##### 2.10 DBN预测和分类 ##### 2.11 FNN预测 ##### 2.12 DELM预测和分类 ##### 2.13 BIlstm预测和分类 ##### 2.14 宽度学习预测和分类 ##### 2.15 模糊小波神经网络预测和分类 ##### 2.16 GRU预测和分类 ### 3 图像处理算法 **3.1 图像识别** 3.1.1 车牌、交通标志识别(新能源、国内外、复杂环境下车牌) 3.1.2 发票、身份证、银行卡识别 3.1.3 人脸类别和表情识别 3.1.4 打靶识别 3.1.5 字符识别(字母、数字、手写体、汉字、验证码) 3.1.6 病灶识别 3.1.7 花朵、药材、水果蔬菜识别 3.1.8 指纹、手势、虹膜识别 3.1.9 路面状态和裂缝识别 3.1.10 行为识别 3.1.11 万用表和表盘识别 3.1.12 人民币识别 3.1.13 答题卡识别 **3.2 图像分割** **3.3 图像检测** 3.3.1 显著性检测 3.3.2 缺陷检测 3.3.3 疲劳检测 3.3.4 病害检测 3.3.5 火灾检测 3.3.6 行人检测 3.3.7 水果分级 **3.4 图像隐藏** **3.5 图像去噪** **3.6 图像融合** **3.7 图像配准** **3.8 图像增强** **3.9 图像压缩** ##### 3.10 图像重建 ### 4 信号处理算法 **4.1 信号识别** **4.2 信号检测** **4.3 信号嵌入和提取** **4.4 信号去噪** ##### 4.5 故障诊断 ##### 4.6 脑电信号 ##### 4.7 心电信号 ##### 4.8 肌电信号 ### 5 元胞自动机仿真 **5.1 模拟交通流** **5.2 模拟人群疏散** **5.3 模拟病毒扩散** **5.4 模拟晶体生长** ### 6 无线传感器网络 ##### 6.1 无线传感器定位 ##### 6.2 无线传感器覆盖优化 ##### 6.3 室内定位 ##### 6.4 无线传感器通信及优化 ##### 6.5 无人机通信继优化 #####

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 2
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

chaser&upper

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值