19期推荐系统实践学习(二）

最新推荐文章于 2023-03-13 20:58:32 发布

shiwy

最新推荐文章于 2023-03-13 20:58:32 发布

阅读量190

点赞数

文章标签：大数据 python 数据分析

原文链接：https://github.com/datawhalechina/team-learning-rs/blob/master/RecommandNews/%E6%95%B0%E6%8D%AE%E5%88%86%E6%9E%90.ipynb

版权

在进行数据分类、推荐之前，首先需要了解数据的基本情况，进而采用不同的方法对数据进行特征提取，因此需要进行数据分析。

数据分析
数据分析的价值主要在于熟悉了解整个数据集的基本情况包括每个文件里有哪些数据，具体的文件中的每个字段表示什么实际含义，以及数据集中特征之间的相关性，在推荐场景下主要就是分析用户本身的基本属性，文章基本属性，以及用户和文章交互的一些分布，这些都有利于后面的召回策略的选择，以及特征工程。

当特征工程和模型调参已经很难继续上分了，可以回来在重新从新的角度去分析这些数据，或许可以找到上分的灵感。

下图是一些数据特征的分布图
在这里插入图片描述
下图是文章主题的直方图：

下图是用户点击的新闻类型的偏好：

总结
通过数据分析的过程，我们目前可以得到以下几点重要的信息，这个对于我们进行后面的特征制作和分析非常有帮助：

训练集和测试集的用户id没有重复，也就是测试集里面的用户没有模型是没有见过的训练集中用户最少的点击文章数是2
而测试集里面用户最少的点击文章数是1 用户对于文章存在重复点击的情况，但这个都存在于训练集里面
同一用户的点击环境存在不唯一的情况，后面做这部分特征的时候可以采用统计特征
用户点击文章的次数有很大的区分度，后面可以根据这个制作衡量用户活跃度的特征
文章被用户点击的次数也有很大的区分度，后面可以根据这个制作衡量文章热度的特征
用户看的新闻，相关性是比较强的，所以往往我们判断用户是否对某篇文章感兴趣的时候，在很大程度上会和他历史点击过的文章有关
用户点击的文章字数有比较大的区别，这个可以反映用户对于文章字数的区别用户点击过的文章主题也有很大的区别，这个可以反映用户的主题偏好
不同用户点击文章的时间差也会有所区别，这个可以反映用户对于文章时效性的偏好所以根据上面的一些分析，可以更好的帮助我们后面做好特征工程，充分挖掘数据的隐含信息。

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
19期推荐系统实践学习(二）

在进行数据分类、推荐之前，首先需要了解数据的基本情况，进而采用不同的方法对数据进行特征提取，因此需要进行数据分析。数据分析数据分析的价值主要在于熟悉了解整个数据集的基本情况包括每个文件里有哪些数据，具体的文件中的每个字段表示什么实际含义，以及数据集中特征之间的相关性，在推荐场景下主要就是分析用户本身的基本属性，文章基本属性，以及用户和文章交互的一些分布，这些都有利于后面的召回策略的选择，以及特征工程。当特征工程和模型调参已经很难继续上分了，可以回来在重新从新的角度去分析这些数据，或许可以找到上分的灵感
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。