我们常常被问到"方差的无偏估计如何计算?和有偏估计的区别是什么?",心想"哎呀,又忘了"。本篇回归问题本质,带你理解这些名词背后解决的实际问题(通过总结回顾,无意中解决了一年以来萦绕脑海的遗留问题,开森~~)。
一、基本概念
解题第一步是理解题意,通过示例首先搞清楚以下几个概念。
假如你想调研所在大学女生的身高,你站在厕所门口(女生一般爱上厕所^~^),随机去问n个女生(独立同分布),最后通过哪些数值来反映身高呢?一般我们都会使用均值。
但如果在调研的时候,你发现有的女生特别高(猜测是校篮球队的),该样本并不能真实反映女生普遍身高,这就导致采集的样本存在异常数据,那么你可以通过方差来度量身高的差异。
由于学校的全体女生身高的均值µ 和方差σ2 未知,这里通过采样计算得到的和 S2,都只是对已知分布中的未知参数的一个估计,这就是估计量。在估计时用到的样本均值和样本方差是用来描述数据特征的,被叫做是统计量。
上面示例提到以下概念,严格定义如下: