统计知识 | 中心极限定理及偏差

总体和样本

  • 总体(population)是包含所研究的全部个体(数据)的集合
  • 样本(sample)是从总体中选取的一部分
  • 样本数量: 有多少样本
  • 样本大小: 每个样本里有多少数据

抽样方法:简单随机抽样、分层抽样、整群抽样、系统抽样等。

中心极限定理

  • 样本的平均值约等于总体的平均值
  • 不管总体是什么分布,任意一个总体的样本平均值总会围绕在总体的平均值周围,并呈正态分布

样本估计总体

方差

衡量随机变量或一组数据时离散程度的度量。
总体方差:
在这里插入图片描述

X为变量,μ总体平均值,N总体例数

实际工作中,总体均数难以得到时,应用样本统计量代替总体参数,经校正后,样本方差计算公式:
在这里插入图片描述
X为变量,-X为样本均值,n为样本例数

标准差

使用作为统计分布程度(statistical dispersion)上的测量。
总体标准差:在这里插入图片描述
样本标准差:在这里插入图片描述
标准误差:在这里插入图片描述

标准差的意义:由于方差是数据的平方,与检测值本身相差太大,人们难以直观的衡量,所以常用方差开根号换算回来这就是我们要说的标准差。

标准误差表示的是抽样的误差,代表的是当前的样本对总体数据的估计,是样本均数与总体均数的相对误差。标准误差由标准差除以样本容量的开平方来计算的,因此,样本容量越大,标准误差越小

如何用样本估计总体

一个正态分布的总体,抽取n个作为样本,可以得到样本平均值,用样本均值估计总体均值需要考虑样本均值的方差或标准差(也就是标准误差)

在这里插入图片描述

如何避免偏差

常见的偏差类型
样本偏差

比如对地域的刻板印象,在某地看到有人随地吐痰,就得出某地人素质不佳;比如看见报道的飞机失事,就得出飞机的安全系数不高等等,这都是基于样本推断整体而产生的偏差。

幸存者偏差

幸存者偏差指的是当取得资讯的渠道,仅来自于幸存者时,此资讯可能会与实际情况存在偏差。

飞机应该如何加强防护,才能降低被炮火击落的几率。根据返航飞机研究机翼是最容易被击中的位置,机尾则是最少被击中的位置,就得出结论飞机应该加强机翼的防护。并非是机尾不易被击中,而是因为机尾被击中的飞机早已无法返航,寥寥几架返航的飞机都依赖相同的救命稻草— 引擎尚好。

概率偏见

主观判断与客观事实不同,而产生的错误判断。

​ ​1.代表性偏差,以偏概全。
​ ​2.可得性偏差,眼见为实。
​ ​3.沉锚效应,先入为主。

信息茧房

指人们关注的信息领域会习惯性地被自己的兴趣所引导,从而将自己的生活桎梏于像蚕茧一般的“茧房”中的现象。

如何避免偏差

1、扩大样本量;
2、尽可能多角度考虑问题,多方面验证;
3、扩充自己的知识储备,用专业的方法思考和验证问题。
4、关闭个性化推荐,更可能多的接触多样的信息。

  • 0
    点赞
  • 4
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值