前面介绍的因子分析和聚类分析都是围绕变量进行的分析,这里的变量不分因变量和自变量。因子分析通过变量结构的研究,达到降低维度的目的,使数量很多的变量浓缩成少量的互相独立的公因子,简化了后续的分析;聚类分析通过研究个案(记录)共有的属性变量,依据它们之间距离的远近,将数量众多的个案(记录)分成几个类型。
判别分析有很多类型,今天介绍的是典型判别分析,从分析原理来看,其与因子分析类似;从模型结构来看,则与前面介绍的逻辑回归相似。
典型判别分析原理
判别分析与因子分析和聚类分析不同,判别分析需要区分因变量和自变量,其中因变量是分类型数据(定类或定序),而自变量可以是任何尺度的数据,只是分类型自变量需要以虚拟变量的形式进入判别模型。以上这些和逻辑回归模型是一致的,不同之处在于判别分析的目的是建立原始变量的线性组合,使得根据因变量划分的不同类别之间差异最大,而逻辑回归模型的拟合方法是极大似然法,它们在模型拟合方法上是完全不同的。如果自变量中连续型变量较多,那么判别分析更为准确,如果分类型变量较多,则逻辑回归分析较为好用,大家可以根据实际分析结果来选择。
判别分析的能够用于很多领域,它可以根据已知样本的分类情况来判断未知待判样本的类别归属。例如,客户信用风险判别、客户分类、地层判断、模式识别等,是应用相当广泛的多元统计技术。
典型判别分析是基于方差分析的思想创造出来的,它试图找到一个由原始自变量组成的线性函数,使得不同总体的组间差异与组内差异的比值最大。如下方左图所示,在原始变量X1和X2组成的坐标系中,两个总体在两个坐标轴上都有部分重合;可喜的是,通过将原始变量X1和