线性相关:主要采用皮尔逊相关系数来度量连续变量之间的线性相关强度;
线性相关系数|r 相关程度
0<=|r|<0.3 低度相关
0.3<=|r|<0.8 中度相关
0.8<=|r|<1 高度相关
1 函数
相关分析函数:
DataFrame.corr()
Series.corr(other)
说明:
如果由数据框调用corr方法,那么将会计算每个列两两之间的相似度
如果由序列调用corr方法,那么只是计算该序列与传入序列之间的相关度
返回值:
dataFrame调用:返回DataFrame
Series调用: 返回一个数值型,大小为相关度
2 案例
import pandas
data=pandas.read_csv(
'D:\\DATA\\pycase\\5.6\\data.csv'
)
# 进行两列之间的相关性分析
data['人口'].corr(data['文盲率'])
## 多列之间的相关度的计算方法
## 选择多列的方法
data[[
'超市购物率','网上购物率','文盲率','人口'
]].corr()