Python与机器学习之Numpy描述性统计

Python与机器学习之相关性(一)

在机器学习应用过程中,遇到复杂的机器学习系统,往往是一个人或者一个团队去研究优化某个部分。而Andrew Ng不止一次的提到,有些公司花六个月去解决一开始就错的问题(Eg. High variance but try more training examples),最后发现该部分根本不影响整体。

如何避免?

其中一种方法:先用简单的数据分析去描述问题,研究问题和特征的相关性。
引申到今天我要分享的一种描述性统计——相关性分析

Pearson相关系数概念

  • 定义——分析变量之间线性相关程度的强弱,并用统计指标表示。
  • 公式——当我们关心这两组数据是否相关,相关程度多少,用协方差(COV)和相关系数(CORRCOEF)来衡量相关程度:
    公式一
    也可以表示为:
    公式二

  • 分析——相关系数r的取值范围:-1≤r≤1

如何应用?

这一步非常重要,很多时候想办法把数据画出来,能体会其中的关联。Andrew Ng亦推荐。

from numpy import array, cov, corrcoef

data = array([data1, data2])

#计算两组数的协方差
#参数bias=1表示结果需要除以N,否则只计算了分子部分
#返回结果为矩阵,第i行第j列的数据表示第i组数与第j组数的协方差。对角线为方差
cov(data, bias=1)

#计算两组数的相关系数
#返回结果为矩阵,第i行第j列的数据表示第i组数与第j组数的相关系数。对角线为1
corrcoef(data)

总结

描述性统计是容易操作,直观简洁的数据分析手段。
如果您看到这篇文章有收获或者有不同的意见,欢迎点赞或者评论。
python:190341254
丁。

附录

Matplotlib
matplotlib

Numpy
numpy

  • 1
    点赞
  • 3
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值