核密度估计(kernel density estimation)kde

kde(kernel density estimation)是核密度估计。核的作用是根据离散采样,估计连续密度分布。

核密度估计是在概率论中用来估计未知的密度函数,属于非参数检验方法之一。由于核密度估计方法不利用有关数据分布的先验知识,对数据分布不附加任何假定,是一种从数据样本本身出发研究数据分布特征的方法,因而,在统计学理论和应用领域均受到高度的重视。

核密度估计其实就是通过核函数(如高斯)将每个数据点的数据+带宽当作核函数的参数,得到N个核函数,再线性叠加就形成了核密度的估计函数,归一化后就是核密度概率密度函数了。

 

                             

假设现在有一系列离散变量X = [4, 5, 5, 6, 12, 14, 15, 15, 16, 17],可见5和15的概率密度应该要高一些,但具体有多高呢?如果要估计的是没有出现过的3呢?这就要自己判断了。

核函数就是给空间的每个离散点都套上一个连续分布。最简单的核函数是Parzen窗,类似一个方波:

                                                                 

在Python中,确定核密度估计Kernel Density Estimation,简称KDE)中的bin数量和宽度是一个重要步骤,因为它直接影响估计的准确性。以下是一些常用的方法: ### 1. 使用Scott公式 Scott公式是一种常用的方法,它根据数据的标准差和样本数量来计算bin的宽度。 ```python import numpy as np import matplotlib.pyplot as plt from scipy.stats import gaussian_kde # 生成一些示例数据 data = np.random.normal(0, 1, 1000) # 使用Scott公式计算bin宽度 std = np.std(data) n = len(data) bin_width = 3.5 * std / (n ** (1/3)) # 计算bin数量 bin_count = int((np.max(data) - np.min(data)) / bin_width) # 进行KDE kde = gaussian_kde(data) # 生成x轴数据 x = np.linspace(np.min(data), np.max(data), 1000) p = kde(x) # 绘制KDE plt.hist(data, bins=bin_count, density=True, alpha=0.5, label='Histogram') plt.plot(x, p, label='KDE') plt.legend() plt.show() ``` ### 2. 使用Silverman公式 Silverman公式是另一种常用的方法,它对Scott公式进行了改进。 ```python # 使用Silverman公式计算bin宽度 bin_width = (std * (4 / (3 * n)) ** 0.2) # 计算bin数量 bin_count = int((np.max(data) - np.min(data)) / bin_width) ``` ### 3. 使用交叉验证 交叉验证是一种更灵活的方法,可以通过最大化似然函数来选择最佳的bin宽度。 ```python # 使用交叉验证选择bin宽度 def cross_validation_bandwidth(data): from sklearn.model_selection import GridSearchCV grid = GridSearchCV(gaussian_kde, {'bw_method': np.linspace(0.1, 1.0, 30)}, cv=5) grid.fit(data) return grid.best_params_['bw_method'] bandwidth = cross_validation_bandwidth(data) kde = gaussian_kde(data, bw_method=bandwidth) p = kde(x) # 绘制KDE plt.hist(data, bins=bin_count, density=True, alpha=0.5, label='Histogram') plt.plot(x, p, label='KDE') plt.legend() plt.show() ``` ###
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值