前言
主成分分析是一种统计学方法,它主要通过降维来简化数据结构,将多个变量转化成少数的几个综合变量,而综合变量能很好地表达原来多个变量的大部分信息,变量之间需要要具备相关性,而经过分析后的变量之间没有相关性。
基本原理
简单从感性角度来了解它的原理就是,比如有两个变量,如下图,看起来它俩的信息量差不多,这时不能忽略某个变量进行降维。
创建一个新的坐标体系PC1和PC2,此时PC1包含的信息量远远大于PC2的,可以忽略掉PC2,于是可以用PC1来表示原来两个维度的信息,达到降维效果。类推到多维情况也是类似如此。