EHSO: Evolutionary Hybrid Sampling in overlapping scenarios for imbalanced learning论文笔记

EHSO: Evolutionary Hybrid Sampling in overlapping scenarios for imbalanced learning论文笔记


在不平衡学习的重叠场景中的进化混合采样

主要思想

为了消除重叠区域中的大多数样本,论文提出了EHSO来处理重叠样本。
通过删除无用的多数类样本,使决策边界更加清晰。
EHSO使用进化算法来寻找分类性能和随机过采样的replicate ratio(复制比)的最优方案。
论文的主要贡献如下:

  1. 通过混合采样平衡样本数据
  2. 设计了一个overlapping ratio(重叠率)与分类性能的适应度函数
  3. 将不平衡率考虑到优化过程中,克服随机过采样引起的过拟合现象

主要步骤

  1. 检测类重叠区域
  2. 通过进化算法来欠采样重叠区域的多数类样本
  3. 随机过采样少数类的样本

1.检测类重叠区域

对于任意多数类样本,如果其K最近邻有任何样本属于少数类,就把这个多数类样本放到重叠集合中。如公式所示

2.通过进化算法进行欠采样

在EHOS中,欠采样的目的使消除重叠区域中的多数类样本,以最大限度地提高多数类和少数类之间的决策边界的可见性。

这一步不是很理解:
EHOS参考EUS( S. García, F. Herrera, Evolutionary undersampling for classification with imbalanced datasets: proposals and taxonomy, Evolutionary Computation 17(3) (2009) 275–306.)多数类都被编码为0和1放到一个染色体中。假设多数类样本的数量为m,每一条染色体是一个m维的向量。1表示多数类样本在重叠区域内,0表示它不再重叠区域内。染色体表达式如下,其中m’代表多数类样本在重叠区域内的个数:
在这里插入图片描述
为了去优化每一代染色体,论文设计了一个适应度函数,EHOS三个优化目标如下:

  1. 最小化不平衡率IR
  2. 最小化重叠比OR
  3. 消除信息较少的多数类样本,尽量减少原始信息的损失

其中不平衡率为:
在这里插入图片描述
重叠率为:
在这里插入图片描述
论文设计的适应度函数如下:其中 α \alpha α表示重要度,代表谁的重要性更高
在这里插入图片描述
论文使用的优化算法是CHC算法(一种改进的遗传算法,还没去了解- -),与GA(遗传算法)相比,CHC强调了优秀个体的保留。
为了减少算法迭代的次数,当全局最优解连续几代都未更新时,将停止迭代。

3.随机过采样

因为最终去除的多数类样本的数量是由CHC算法和数据分布的特征确定的。如果某些数据集中的数字相对较小,那么多数类与少数类还是存在数量上的差异。
因此需要使用过采样技术来将欠采样后的样本平衡化。

算法的伪代码

在这里插入图片描述

  • 0
    点赞
  • 2
    收藏
    觉得还不错? 一键收藏
  • 1
    评论
智慧农业是一种结合了现代信息技术,包括物联网、大数据、云计算等,对农业生产过程进行智能化管理和监控的新模式。它通过各种传感器和设备采集农业生产中的关键数据,如大气、土壤和水质参数,以及生物生长状态等,实现远程诊断和精准调控。智慧农业的核心价值在于提高农业生产效率,保障食品安全,实现资源的可持续利用,并为农业产业的转型升级提供支持。 智慧农业的实现依赖于多个子系统,包括但不限于设施蔬菜精细化种植管理系统、农业技术资料库、数据采集系统、防伪防串货系统、食品安全与质量追溯系统、应急追溯系统、灾情疫情防控系统、农业工作管理系统、远程诊断系统、监控中心、环境监测系统、智能环境控制系统等。这些系统共同构成了一个综合的信息管理和服务平台,使得农业生产者能够基于数据做出更加科学的决策。 数据采集是智慧农业的基础。通过手工录入、传感器自动采集、移动端录入、条码/RFID扫描录入、拍照录入以及GPS和遥感技术等多种方式,智慧农业系统能够全面收集农业生产过程中的各种数据。这些数据不仅包括环境参数,还涵盖了生长状态、加工保存、检验检疫等环节,为农业生产提供了全面的数据支持。 智慧农业的应用前景广阔,它不仅能够提升农业生产的管理水平,还能够通过各种应用系统,如库房管理、无公害监控、物资管理、成本控制等,为农业生产者提供全面的服务。此外,智慧农业还能够支持政府监管,通过发病报告、投入品报告、死亡报告等,加强农业产品的安全管理和质量控制。 面对智慧农业的建设和发展,存在一些挑战,如投资成本高、生产过程标准化难度大、数据采集和监测的技术难题等。为了克服这些挑战,需要政府、企业和相关机构的共同努力,通过政策支持、技术创新和教育培训等手段,推动智慧农业的健康发展。智慧农业的建设需要明确建设目的,选择合适的系统模块,并制定合理的设备布署方案,以实现农业生产的智能化、精准化和高效化。
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值