箱线图概述
箱线图又称箱形图或盒须图,主要从四分位数的角度来描述数据的分布。一个箱线图由上边缘线、上四分位数(QU)、中位数(me),下四分位数(QL)和下边缘线组成。
上、下四分位数之差称为四分位差,或内距或四分位数间距,记为IQR:
IQR = QU - QL
箱线图中盒子的上、下线分别是上、下四分位数,盒子中间的线是中位数。由触须延长的上、下边缘线分别为:
上边缘线的值 = QU + 1.5 IQR
下边缘线的值 = QL - 1.5 IQR
也有用数据的极大值和极小值来表示上下边缘线的值的(但使用这种表示上下边缘的方法无法检测异常值)。
一个箱线图的形式如下图所示:
异常值检测原理
箱形图为我们提供了识别异常值的一个标准:异常值被定义为小于QL-1.5IQR或大于QU+1.5IQR的值。虽然这种标准有点任意性,但它来源于经验判断,经验表明它在处理需要特别注意的数据方面表现不错。这与识别异常值的经典方法有些不同。众所周知,基于正态分布的3σ法则或z分数方法是以假定数据服从正态分布为前提的,但实际数据往往并不严格服从正态分布。它们判断异常值的标准是以计算数据批的均值和标准差为基础的,而均值和标准差的耐抗性极小,异常值本身会对它们产生较大影响,这样产生的异常值个数不会多于总数0.7%。显然,应用这种方法于非正态分布数据中判断异常值,其有效性是有限的。
箱形图的绘制依靠实际数据,不需要事先假定数据服从特定的分布形式,没有对数据作任何限制性要求,它只是真实直观地表现数据形状的本来面貌&#