推荐新闻-数据分析

最新推荐文章于 2022-09-03 01:55:16 发布

lz你ps

最新推荐文章于 2022-09-03 01:55:16 发布

阅读量1k

点赞数

文章标签：机器学习人工智能数据分析推荐系统

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/qq_25202521/article/details/110249425

版权

目录

1. 目的
2. 流程
3. 数据探索
4. 数据分析
5. 总结

1. 目的

数据分析的目的是解数据集的整体情况，了解每个字段的含义，了解特征之间的关联性，以便更好地做特征工程工作。

2. 流程

主要分为数据读取、数据预处理、数据浏览和数据分析等过程。下面重点看数据浏览和数据分析部分。

3. 数据探索

用户点击日志文件_训练集
在这里插入图片描述
用户点击日志文件_测试集

新闻文章信息数据表

新闻文章embedding向量表示

4. 数据分析

用户重复点击
在这里插入图片描述
用户点击环境变化分析

省略若干图

用户点击新闻数量的分布
在这里插入图片描述
新闻点击次数分析

新闻共现频次：两篇新闻连续出现的次数

新闻文章信息
在这里插入图片描述

用户点击的新闻类型的偏好
在这里插入图片描述
** 用户查看文章的长度的分布**

用户点击新闻的时间分析

5. 总结

通过数据分析的过程，我们目前可以得到以下几点重要的信息，这个对于我们进行后面的特征制作和分析非常有帮助：

训练集和测试集的用户id没有重复，也就是测试集里面的用户模型是没有见过的
训练集中用户最少的点击文章数是2，而测试集里面用户最少的点击文章数是1
用户对于文章存在重复点击的情况，但这个都存在于训练集里面
同一用户的点击环境存在不唯一的情况，后面做这部分特征的时候可以采用统计特征
用户点击文章的次数有很大的区分度，后面可以根据这个制作衡量用户活跃度的特征
文章被用户点击的次数也有很大的区分度，后面可以根据这个制作衡量文章热度的特征
用户看的新闻，相关性是比较强的，所以往往我们判断用户是否对某篇文章感兴趣的时候，在很大程度上会和他历史点击过的文章有关
用户点击的文章字数有比较大的区别，这个可以反映用户对于文章字数的区别
用户点击过的文章主题也有很大的区别，这个可以反映用户的主题偏好 10.不同用户点击文章的时间差也会有所区别，这个可以反映用户对于文章时效性的偏好
所以根据上面的一些分析，可以更好的帮助我们后面做好特征工程，充分挖掘数据的隐含信息。

参考：零基础入门推荐系统【数据分析】Task2

关注

0
点赞
踩
5

收藏

觉得还不错? 一键收藏
0
评论
推荐新闻-数据分析

目录1. 目的2. 流程3. 数据探索4. 数据分析5. 总结1. 目的数据分析的目的是解数据集的整体情况，了解每个字段的含义，了解特征之间的关联性，以便更好地做特征工程工作。2. 流程主要分为数据读取、数据预处理、数据浏览和数据分析等过程。下面重点看数据浏览和数据分析部分。3. 数据探索用户点击日志文件_训练集用户点击日志文件_测试集新闻文章信息数据表新闻文章embedding向量表示4. 数据分析用户重复点击用户点击环境变化分析省略若干图用户点击新闻数量的分布
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。