来源于吉林大学刘华文博士论文《基于信息熵的特征选择算法研究》
随着新技术的不断出现,现实中数据集朝着大规模方向发展,并呈现样本少、维数高等特点,这给传统的数据分类学习带来了巨大的挑战,其中冗余特征的存在间接加重这种不利影响。因此,如何从高维数据中剔除冗余或无关的特征,以避免维灾难问题,使得传统学习算法仍然能在高维数据上进行学习训练是目前人们面临的一道难题。特征选择就是在这种情况下提出的,它主要是指从数据的原始特征中选择一个最优特征子集,使得它包含原始特征的全部或大部分分类信息的过程。目前,特征选择是数据挖掘、统计模式识别和机器学习等领域的重要研究课题之一,在实际情况中也得到了广泛的应用。 本文首先介绍数据挖掘中的分类问题,然后阐述特征选择问题的研究现状和研究热点等,并重点讨论信息度量标准。然后针对数据中冗余特征的消除问题,以信息理论中信息熵和互信息为基础,围绕如何度量特征之间相关性这一主体,开展了一系列的研究工作,以解决不同的数据分类预测问题。