CDF(cumulative distribution function)叫做累积分布函数
描述一个实数随机变量X的概率分布,是概率密度函数的积分。
我觉得它的最主要作用就是观测某些数值也就是随机变量的取值在那个附近出现的概率比较大,它是一个增函数. 可以有效的处理一些异常值.
随机变量小于或者等于某个数值的概率P(X<=x),即:F(x) = P(X<=x)
累积分布函数(cumulative distribution function):对连续函数,所有小于等于a的值,其出现概率的和。F(a)=P(x<=a)
根据这张累积分布函数图,可以很方便地回答之前的两个问题:
1)CDF中横轴上的2对应的Y值约为0.98,因此所有大于2的数据点所占比例约为2%。
2)CDF中横轴上的1.3对应的Y值约为0.75,因此所有介于1.3和2之间的数据点所占比例约为23% (0.98-0.75)。
与直方图、核密度估计相比,累积分布函数存在以下几个特点:
累积分布函数是X轴单调递增函数。
累积分布函数更加平滑,图像中噪音更小。
累积分布函数没有引入带宽等外部概念,因此不会丢失任何数据信息。对于给定的数据集,累积分布函数是唯一的。
累积分布函数一般都经过归一化处理,单调递增且趋近于1。
下面我们来讲一下怎么用matlab来画我们的累