mllib调参 spark_SparkMLlib分类算法之决策树学习

最新推荐文章于 2023-09-20 10:04:09 发布

weixin_39680208

最新推荐文章于 2023-09-20 10:04:09 发布

阅读量213

点赞数

文章标签： mllib调参 spark

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_39680208/article/details/111526364

版权

本文主要介绍了Spark MLlib中的决策树分类算法，包括决策树的基本概念、SparkMLlib的应用、模型构建与评价，以及模型参数调优。通过对数据集的预处理、标准化，构建了决策树模型，并通过改变树的深度和纯度参数进行调优，以提高模型性能。在评估中，使用了AUC作为指标，展示了不同参数设置对模型的影响。

摘要由CSDN通过智能技术生成

SparkMLlib分类算法之决策树学习

(一) 决策树的基本概念

决策树(Decision Tree)是在已知各种情况发生概率的基础上，通过构成决策树来求取净现值的期望值大于等于零的概率，评价项目风险，判断其可行性的决策分析方法，是直观运用概率分析的一种图解法。由于这种决策分支画成图形很像一棵树的枝干，故称决策树。在机器学习中，决策树是一个预测模型，他代表的是对象属性与对象值之间的一种映射关系。Entropy = 系统的凌乱程度，使用算法ID3, C4.5和C5.0生成树算法使用熵。这一度量是基于信息学理论中熵的概念。通过信息增益来筛选出属性的优先性。

1)对连续性的字段比较难预测。

2)对有时间顺序的数据，需要很多预处理的工作。

3)当类别太多时，错误可能就会增加的比较快。

4)一般的算法分类的时候，只是根据一个字段来分类。

(二) SparkMLlib对决策树应用

1，数据集的准备：参考：http://www.cnblogs.com/ksWorld/p/6882398.html

2，数据预处理及获取训练集和测试集

val orig_file=sc.textFile("train_nohead.tsv")//println(orig_file.first())

val data_file=orig_file.map(_.split("\t")).map{

r=>val trimmed=r.map(_.r

最低0.47元/天解锁文章

weixin_39680208

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
mllib调参 spark_SparkMLlib分类算法之决策树学习

SparkMLlib分类算法之决策树学习(一) 决策树的基本概念决策树(Decision Tree)是在已知各种情况发生概率的基础上，通过构成决策树来求取净现值的期望值大于等于零的概率，评价项目风险，判断其可行性的决策分析方法，是直观运用概率分析的一种图解法。由于这种决策分支画成图形很像一棵树的枝干，故称决策树。在机器学习中，决策树是一个预测模型，他代表的是对象属性与对象值之间的一种映射关系。En...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。