调参小技巧-DBSCAN参数选取方法

最新推荐文章于 2025-03-20 11:19:41 发布

宋建国

最新推荐文章于 2025-03-20 11:19:41 发布

阅读量3.9w

点赞数 16

分类专栏：机器学习

本文链接：https://blog.csdn.net/hot7732788/article/details/90051607

版权

机器学习专栏收录该内容

12 篇文章

订阅专栏

本文介绍了一种基于DBSCAN算法的参数调优方法，通过迭代不同参数值来寻找最佳聚类效果。文章详细展示了如何使用sklearn库进行数据预处理，以及如何通过循环迭代eps和min_samples参数，评估不同参数组合下的聚类数量、异常值数量和样本分布情况。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

利用循环迭代一些参数变量选取最适合的参数

1.初始数据处理部分，请自行对照调整，此处仅作为保持流程完整使用。

# 读入第三方包
from sklearn import preprocessing
# 选取建模的变量
predictors = ['Birth_Rate','Death_Rate']
# 变量的标准化处理
X = preprocessing.scale(Province[predictors])
X = pd.DataFrame(X)

2.迭代不同值得参数

# 构建空列表，用于保存不同参数组合下的结果
res = []
# 迭代不同的eps值
for eps in np.arange(0.001,1,0.05):
    # 迭代不同的min_samples值
    for min_samples in range(2,10):
        dbscan = cluster.DBSCAN(eps = eps, min_samples = min_samples)
        # 模型拟合
        dbscan.fit(X)
        # 统计各参数组合下的聚类个数（-1表示异常点）
        n_clusters = len([i for i in set(dbscan.labels_) if i != -1])
        # 异常点的个数
        outliners = np.sum(np.where(dbscan.labels_ == -1, 1,0))
        # 统计每个簇的样本个数
        stats = str(pd.Series([i for i in dbscan.labels_ if i != -1]).value_counts().values)
        res.append({'eps':eps,'min_samples':min_samples,'n_clusters':n_clusters,'outliners':outliners,'stats':stats})
# 将迭代后的结果存储到数据框中        
df = pd.DataFrame(res)

# 根据条件筛选合理的参数组合
df.loc[df.n_clusters == 3, :]