典型相关分析相关资料

典型相关分析(Canonical Correlation Analysis, CCA)是一种用于衡量两组多维变量间线性关系的方法。它寻找两组变量的最佳线性组合,以最大化它们之间的相关性。在实际应用中,例如分析两个人的解题能力和阅读能力之间的关联,通过计算特征的典型变量,可以得到最大的相关系数。CCA不仅限于线性关系,还可以通过Kernel CCA(KCCA)处理非线性关系。此外,当协方差矩阵不可逆时,可通过正则化处理。" 115185276,10157941,Android Studio:Fragment切换动画实战,"['Android开发', '移动开发', 'app', 'UI设计', 'Android Studio']
摘要由CSDN通过智能技术生成

典型相关分析的基本思想 Canonical Correlation Analysis

 

CCA典型相关分析
(canonical correlation analysis)利用综合变量对之间的相关关系来反映两组指标之间的整体相关性的多元统计分析方法。它的基本原理是:为了从总体上把握两组指标之间的相关关系,分别在两组变量中提取有代表性的两个综合变量U1和V1(分别为两个变量组中各变量的线性组合),利用这两个综合变量之间的相关关系来反映两组指标之间的整体相关性。

 

Canonical Correlation Analysis典范相关分析/Canonical Correspondence Analysis典范对应分析

 

简单相关系数描述两组变量的相关关系的缺点:只是孤立考虑单个X与单个Y间的相关,没有考虑X、Y变量组内部各变量间的相关。两组间有许多简单相关系数,使问题显得复杂,难以从整体描述。典型相关是简单相关、多重相关的推广。典型相关是研究两组变量之间相关性的一种统计分析方法。也是一种降维技术。
1936年,Hotelling提出典型相关分析。考虑两组变量的线性组合, 并研究它们之间的相关系数p(u,v).在所有的线性组合中, 找一对相关系数最大的线性组合, 用这个组合的单相关系数来表示两组变量的相关性, 叫做两组变量的典型相关系数, 而这两个线性组合叫做一对典型变量。在两组多变量的情形下, 需要用若干对典型变量才能完全反映出它们之间的相关性。下一步, 再在两组变量的与u1,v1不相关的线性组合中, 找一对相关系数最大的线性组合, 它就是第二对典型变量, 而且p(u2,v2)就是第二个典型相关系数。这样下去, 可以得到若干对典型变量, 从而提取出两组变量间的全部信息。
典型相关分析的实质就是在两组随机变量中选取若干个有代表性的综合指标(变量的线性组合), 用这些指标的相关关系来表示原来的两组变量的相关关系。这在两组变量的相关性分析中, 可以起到合理的简化变量的作用; 当典型相关系数足够大时, 可以像回归分析那样, 由- 组变量的数值预测另一组变量的线性组合的数值。

 

 

典型关联分析(Canonical Correlation Analysis)

[pdf版本] 典型相关分析.pdf
1. 问题

在线性回归中,我们使用直线来拟合样本点,寻找n维特征向量X和输出结果(或者叫做label)Y之间的线性关系。其中clip_image002clip_image004。然而当Y也是多维时,或者说Y也有多个特征时,我们希望分析出X和Y的关系。

当然我们仍然可以使用回归的方法来分析,做法如下:

假设clip_image002[1]clip_image006,那么可以建立等式Y=AX如下

clip_image008

其中clip_image010,形式和线性回归一样,需要训练m次得到m个clip_image012

这样做的一个缺点是,Y中的每个特征都与X的所有特征关联,Y中的特征之间没有什么联系。

我们想换一种思路来看这个问题,如果将X和Y都看成整体,考察这两个整体之间的关系。我们将整体表示成X和Y各自特征间的线性组合,也就是考察clip_image014clip_image016之间的关系。

这样的应用其实很多,举个简单的例子。我们想考察一个人解题能力X(解题速度clip_image018,解题正确率clip_image020)与他/她的阅读能力Y(阅读速度clip_image022,理解程度clip_image024)之间的关系,那么形式化为:

clip_image026 clip_image028

然后使用Pearson相关系数

clip_image030

来度量u和v的关系,我们期望寻求一组最优的解a和b,使得Corr(u, v)最大,这样得到的a和b就是使得u和v就有最大关联的权重。

到这里,基本上介绍了典型相关分析的目的。

2. CCA表示与求解

给定两组向量clip_image032clip_image034(替换之前的x为clip_image032[1],y为clip_image034[1]),clip_image032[2]维度为clip_image036clip_image034[2]维度为clip_image038,默认clip_image040。形式化表示如下:

clip_image042

clip_image044是x的协方差矩阵;左上角是clip_image032[3]自己的协方差矩阵;右上角是clip_image046;左下角是clip_image048,也是clip_image050的转置;右下角是clip_image034[3]的协方差矩阵。

与之前一样,我们从clip_image032[4]clip_image034[4]的整体入手,定义

clip_image052 clip_image054

我们可以算出u和v的方差和协方差:

clip_image056 clip_image058 clip_image060

上面的结果其实很好算,推导一下第一个吧:

clip_image062

最后,我们需要算Corr(u,v)了

clip_image064

我们期望Corr(u,v)越大越好,关于Pearson相关系数,《数据挖掘导论》给出了一个很好的图来说明:

clip_image066

横轴是u,纵轴是v,这里我们期望通过调整a和b使得u和v的关系越像最后一个图越好。其实第一个图和最后一个图有联系的,我们可以调整a和b的符号,使得从第一个图变为最后一个。

接下来我们求解a和b。

回想在LDA中,也得到了类似Corr(u,v)的公式,我们在求解时固定了分母,来求分子(避免a和b同时扩大n倍仍然符号解条件的情况出现)。这里我们同样这么做。

这个优化问题的条件是:

Maximize clip_image068

Subject to: clip_image070

求解方法是构造Lagrangian等式,这里我简单推导如下:

clip_image072

求导,得

clip_image074

clip_image076

令导数为0后,得到方程组:

clip_image078

clip_image080

第一个等式左乘clip_image082,第二个左乘clip_image084,再根据clip_image086,得到

clip_image088

也就是说求出的clip_image090即是Corr(u,v),只需找最大clip_image090[1]即可。

让我们把上面的方程组进一步简化,并写成矩阵形式,得到

clip_image092

评论 7
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值