利用python实现方差分析
简介
方差分析是一种常用的对数据进行分析的方法,用于两个及两个以上样本均数和方差差别的显著性检验。本文介绍单因素方差分析和双因素方差分析。
方差分析存在三个假设:
1、各样本总体服从正态分布。
2、各样本总体方差一样。
3、各样本总体相互独立。
单因素方差分析
单因素方差分析就是在只有一种影响因素下判断各个样本间的均值差别的显著性。
数据会有一个总的方差(SST),这个方差可分为:因素影响产生(SSA)和由于随机误差产生(SSE)。
单因素方差分析的过程分为5步:
1、做出假设:H0:u1 = u2 = u3=…un。
2、选取置信度:sig。
3、选取测试数据的方法:F分布。
4、利用数据进行计算。
5、通过计算的数据得到的结果做出判断。
计算数学公式如下:
其中SSE服从自由度为n-k的卡方分布,SSA服从自由度为k-1的卡方分布。n为样本容量,k为影响因素的分组数。最后利用F分布来计算显著度。
通过python可以通过如下方式实现:
#one_way variance analysis for mean
def oneway_var_test(df, sig):
data = np.array(df)
x = np.mean(data)
n = len(data)*len(data[0])
k = len(data[0])
m = len(data)
SStotal = np.var(data)*n
df_total = n-1
SSE = np.var(df).sum()*m
SST = (np.square(np.mean(df)-np.mean(arr))).sum()*m
df_e = n-k
df_t = k-1
MST = SST/df_t
MSE = SSE/df_e
F