pandas相关系数-DataFrame.corr()参数详解

最新推荐文章于 2025-04-22 16:55:29 发布

置顶 walking_visitor

最新推荐文章于 2025-04-22 16:55:29 发布

阅读量9.8w

点赞数 54

分类专栏： Python Pandas 文章标签： pandas DataFrame corr 相关系数

本文链接：https://blog.csdn.net/walking_visitor/article/details/85128461

版权

Python 同时被 2 个专栏收录

18 篇文章

订阅专栏

Pandas

9 篇文章

订阅专栏

本文详细解析了Pandas库中corr函数的使用方法及参数，包括'pearson'、'kendall'和'spearman'三种相关系数计算方式的区别，并通过实验对比了它们在非线性数据上的表现。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

DataFrame.corr(method='pearson', min_periods=1)

参数说明：

method：可选值为{‘pearson’, ‘kendall’, ‘spearman’}

pearson：Pearson相关系数来衡量两个数据集合是否在一条线上面，即针对线性数据的相关系数计算，针对非线性数据便会有误差。

kendall：用于反映分类变量相关性的指标，即针对无序序列的相关系数，非正太分布的数据

spearman：非线性的，非正太分布的数据的相关系数

min_periods：样本最少的数据量

返回值：各类型之间的相关系数DataFrame表格。

为区分不同参数之间的区别，我们实验如下：

from pandas import DataFrame
import pandas as pd
x=[a for a in range(100)]
#构造一元二次方程，非线性关系
def y_x(x):
    return 2*x**2+4
y=[y_x(i) for i in x]

data=DataFrame({'x':x,'y':y})

#查看下data的数据结构
data.head()
Out[34]: 
   x   y
0  0   4
1  1   6
2  2  12
3  3  22
4  4  36

data.corr()
Out[35]: 
          x         y
x  1.000000  0.967736
y  0.967736  1.000000

data.corr(method='spearman')
Out[36]: 
     x    y
x  1.0  1.0
y  1.0  1.0

data.corr(method='kendall')
Out[37]: 
     x    y
x  1.0  1.0
y  1.0  1.0

因为y经由函数构造出来，x和y的相关系数为1，但从实验结构可知pearson系数，针对非线性数据有一定的误差。

需要说明，数据之间的相关关系，并不代表其之间的因果关系，相关系数为1，只能说明二者之间具备完全相关性，但不能说y是x的果。