总体和样本
- 总体(population)是包含所研究的全部个体(数据)的集合
- 样本(sample)是从总体中选取的一部分
- 样本数量: 有多少样本
- 样本大小: 每个样本里有多少数据
抽样方法:简单随机抽样、分层抽样、整群抽样、系统抽样等。
中心极限定理
- 样本的平均值约等于总体的平均值
- 不管总体是什么分布,任意一个总体的样本平均值总会围绕在总体的平均值周围,并呈正态分布
样本估计总体
方差
衡量随机变量或一组数据时离散程度的度量。
总体方差:
X为变量,μ总体平均值,N总体例数
实际工作中,总体均数难以得到时,应用样本统计量代替总体参数,经校正后,样本方差计算公式:
X为变量,-X为样本均值,n为样本例数
标准差
使用作为统计分布程度(statistical dispersion)上的测量。
总体标准差:
样本标准差:
标准误差:
标准差的意义:由于方差是数据的平方,与检测值本身相差太大,人们难以直观的衡量,所以常用方差开根号换算回来这就是我们要说的标准差。
标准误差表示的是抽样的误差,代表的是当前的样本对总体数据的估计,是样本均数与总体均数的相对误差。标准误差由标准差除以样本容量的开平方来计算的,因此,样本容量越大,标准误差越小
如何用样本估计总体
一个正态分布的总体,抽取n个作为样本,可以得到样本平均值,用样本均值估计总体均值需要考虑样本均值的方差或标准差(也就是标准误差)
如何避免偏差
常见的偏差类型
样本偏差
比如对地域的刻板印象,在某地看到有人随地吐痰,就得出某地人素质不佳;比如看见报道的飞机失事,就得出飞机的安全系数不高等等,这都是基于样本推断整体而产生的偏差。
幸存者偏差
幸存者偏差指的是当取得资讯的渠道,仅来自于幸存者时,此资讯可能会与实际情况存在偏差。
飞机应该如何加强防护,才能降低被炮火击落的几率。根据返航飞机研究机翼是最容易被击中的位置,机尾则是最少被击中的位置,就得出结论飞机应该加强机翼的防护。并非是机尾不易被击中,而是因为机尾被击中的飞机早已无法返航,寥寥几架返航的飞机都依赖相同的救命稻草— 引擎尚好。
概率偏见
主观判断与客观事实不同,而产生的错误判断。
1.代表性偏差,以偏概全。
2.可得性偏差,眼见为实。
3.沉锚效应,先入为主。
信息茧房
指人们关注的信息领域会习惯性地被自己的兴趣所引导,从而将自己的生活桎梏于像蚕茧一般的“茧房”中的现象。
如何避免偏差
1、扩大样本量;
2、尽可能多角度考虑问题,多方面验证;
3、扩充自己的知识储备,用专业的方法思考和验证问题。
4、关闭个性化推荐,更可能多的接触多样的信息。