机器学习 -- 聚类算法（下）

默默成长的小咸鱼

已于 2022-07-07 17:50:06 修改

阅读量242

点赞数

文章标签：机器学习算法聚类

于 2022-01-12 19:48:14 首次发布

本文链接：https://blog.csdn.net/weixin_57003452/article/details/122460859

版权

本文深入探讨了机器学习中的特征降维，包括降维的定义、两种降维方式——特征选择和主成分分析（PCA）。介绍了PCA的基本概念、API以及数据计算示例。同时，讲解了特征选择的方差选择法、相关系数，以及皮尔逊和斯皮尔曼相关系数的计算和应用。最后，通过案例展示了如何在用户物品类别喜好细分上应用PCA和聚类算法。

摘要由CSDN通过智能技术生成

6.6 特征降维

1 降维

1.1 定义

降维是指在某些限定条件下，降低随机变量(特征)个数，得到一组“不相关”主变量的过程

降低随机变量的个数

相关特征(correlated feature)
- 相对湿度与降雨量之间的相关
- 等等

正是因为在进行训练的时候，我们都是使用特征进行学习。如果特征本身存在问题或者特征之间相关性较强，对于算法学习预测会影响较大

1.2 降维的两种方式

特征选择
主成分分析（可以理解一种特征提取的方式）

2 特征选择

2.1 定义

数据中包含冗余或无关变量（或称特征、属性、指标等），旨在从原有特征中找出主要特征。

2.2 方法

Filter(过滤式)：主要探究特征本身特点、特征与特征和目标值之间关联
- 方差选择法：低方差特征过滤
- 相关系数
Embedded (嵌入式)：算法自动选择特征（特征与目标值之间的关联）
- 决策树:信息熵、信息增益
- 正则化：L1、L2
- 深度学习：卷积等

2.3 低方差特征过滤

删除低方差的一些特征，前面讲过方差的意义。再结合方差的大小来考虑这个方式的角度。

特征方差小：某个特征大多样本的值比较相近
特征方差大：某个特征很多样本的值都有差别

2.3.1 API

sklearn.feature_selection.VarianceThreshold(threshold = 0.0)
- 删除所有低方差特征
- Variance.fit_transform(X)
  - X:numpy array格式的数据[n_samples,n_features]
  - 返回值：训练集差异低于threshold的特征将被删除。默认值是保留所有非零方差特征，即删除所有样本中具有相同值的特征。

2.3.2 数据计算

我们对某些股票的指标特征之间进行一个筛选，除去'index,'date','return'列不考虑（这些类型不匹配，也不是所需要指标）

一共这些特征

pe_ratio,pb_ratio,market_cap,return_on_asset_net_profit,du_return_on_equity,ev,earnings_per_share,revenue,total_expense

index,pe_ratio,pb_ratio,market_cap,return_on_asset_net_profit,du_return_on_equity,ev,earnings_per_share,revenue,total_expense,date,return
0,000001.XSHE,5.9572,1.1818,85252550922.0,0.8008,14.9403,1211444855670.0,2.01,20701401000.0,10882540000.0,2012-01-31,0.027657228229937388
1,000002.XSHE,7.0289,1.588,84113358168.0,1.6463,7.8656,300252061695.0,0.326,29308369223.2,23783476901.2,2012-01-31,0.08235182370820669
2,000008.XSHE,-262.7461,7.0003,517045520.0,-0.5678,-0.5943,770517752.56,-0.006,11679829.03,12030080.04,2012-01-31,0.09978900335112327
3,000060.XSHE,16.476,3.7146,19680455995.0,5.6036,14.617,28009159184.6,0.35,9189386877.65,7935542726.05,2012-01-31,0.12159482758620697
4,00006

最低0.47元/天解锁文章

默默成长的小咸鱼

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
机器学习 -- 聚类算法（下）

6.6 特征降维1 降维1.1 定义降维是指在某些限定条件下，降低随机变量(特征)个数，得到一组“不相关”主变量的过程降低随机变量的个数相关特征(correlated feature) 相对湿度与降雨量之间的相关等等正是因为在进行训练的时候，我们都是使用特征进行学习。如果特征本身存在问题或者特征之间相关性较强，对于算法学习预测会影响较大1.2 降维的两种方式特征选择主成分分析（可以理解一种特征提取的方式）2 特征选择2.1 定义数据中包含冗.
复制链接

扫一扫