数据挖掘实战——交通大数据预测II

最新推荐文章于 2023-12-21 01:52:58 发布

小雨姑娘

最新推荐文章于 2023-12-21 01:52:58 发布

阅读量1w

点赞数 4

分类专栏： DataMining学习笔记文章标签：数据挖掘天池 xgboost 流程

本文链接：https://blog.csdn.net/qq_36988549/article/details/78030611

版权

博主分享了参与阿里天池数据挖掘比赛的经历，从第一赛季到第二赛季，全程使用Xgboost建模，通过特征工程和模型优化逐步降低MAPE。重点介绍了Xgboost的应用，特征的选取与处理，以及目标函数的调整。最终在第二赛季取得显著进步，总结了比赛中的经验和教训。

摘要由CSDN通过智能技术生成

经过了近两个月的艰苦工作，这次在阿里天池的比赛终于结束了。第一次正经的去参加数据挖掘的比赛，从第一赛季开始到第二赛季结束，完整地经历了整个流程，每天提出新想法，学习新的方法，然后用编程的方法去实现，看着自己的MAPE一天天的下降，那种感觉也是很棒的。觉得付出了很多，也收获了很多，自己也找到了自己的方向，希望自己在未来可以朝着大数据和人工智能方向继续前行。而且这次比赛之后，自己在剩下三年的大学时光中还会继续参加很多这种比赛的，觉得这种比赛要比基础算法比赛更有趣，漫长的周期也更适合我比较散漫的生活方式。在这里回顾一下比赛，总结一下比赛的经验和教训吧。

第一赛季：

初次接触数据挖掘大赛。

第一次参加数据挖掘比赛，虽然前面打过KDD CUP的比赛，而且类型都是差不多的，但是那次也只是分析了一下数据，然后用统计量做了一下填补而已。而这次我们要动真格的了，我们要用机器学习的模型去生成结果——大杀器Xgboost。至于Xgboost的厉害之处，我会在另一篇blog上写一下，据老师私下里给各个模型的排名，Xgboost除了在图像处理上略逊于深度学习，在其他领域上应该都是最厉害的模型了。

第一次提交结果。

第一天的时候，我们并没有去分析什么数据（其实以后也没怎么分析，我认为这也是我们犯下的一个很大的错误），而是直接去填了一个历史中位数，我当时并没有理解为什么要用这么个简单的中位数去填补结果，只是在第二天早上起来睡得懵懵地看了一眼线上结果，MAPE在0.4284，在当天排名中占25名。当时感觉还不错的，也没有在意什么别