最近几个月忙着写论文,比赛给抛到脑后了(汗颜。。)。昨天阿里给了短信通知,说今天可以提交成绩了,于是抓紧搞起,结果也没赶上截止时间(早上10点)提交。无论如何今天也要提交一次成绩试试水。比赛的详细思路其实我也没怎么想好,有一些初步的想法和实践分享一下。
思路
我的想法比较简单,就是先用最简单的方法做一下,提交一次成绩,让自己有参与感,然后在后续不断的迭代更新中提升自己。我们采用倒推方式,首先从提交结果出发开始分析:
1、需要提交的结果如下:
要预测该表要求的60天数据,首先要将artist_id(表mars_tianchi_songs),Plays(表mars_tianchi_user_actions),Ds(表mars_tianchi_user_actions)统一到一个表中。
2、下一步就是,如何统一?
表mars_tianchi_songs和表mars_tianchi_user_actions有相同的一个列名就是song_id。所以可以将该列名作为key(键值)进行合并。这一步操作可以通过pandas (Python Data Analysis Library)中的merge函数实现。仔细观察后发现两个表的song_id行数不相等,不能直接合并,下一步就是对表做预处理使其能够合并。
3、如何对表做预处理?
歌曲艺人