推荐系统学习（2）——基于TF-IDF的改进

最新推荐文章于 2023-07-28 09:36:31 发布

大禹不治水

最新推荐文章于 2023-07-28 09:36:31 发布

阅读量4.4k

点赞数 1

分类专栏：推荐系统学习文章标签： idf 算法标签推荐

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/minedayu/article/details/39903635

版权

文章探讨了如何利用TF-IDF技术改进基于用户打标签次数和物品打标签次数的推荐算法，以减少热门物品推荐，增强个性化。通过引入TF-IDF，可以更准确地衡量标签的重要性，从而提供更精准的推荐。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

使用用户打标签次数*物品打标签次数做乘积的算法虽然简单，但是会造成热门物品推荐的情况。物品标签的权重是物品打过该标签的次数，用户标签的权重是用户使用过该标签的次数，从而导致个性化的推荐降低，而造成热门推荐。

运用TF-IDF的思想可以对算法进行改进。TF-IDF（term frequemcy-inverse documnet frequency）是一种用于资讯检索和文本挖掘的加权技术。用来评估一个词的重要程度。其主要思想是如果某个词或短语在一篇文章中出现的频率TF高，并且在其他文章中很少出现，则认为此词或者短语具有很好的类别区分能力，适合用来分类。IDF是逆向文件频率，即包含某个term的文件越少，则IDF越大。

IDF可以由总文件数目除以包含该词语的文件的数目，然后取对数得到：

$\mathrm{idf_{i}} = \log \frac{|D|}{|\{j: t_{i} \in d_{j}\}|}$

其中D代表文件的总数，分母代表包含该词语的文件的数目，为避免分母为0，通常用1+分母作为当前的分母。这样，当包含该词语的文件在总文件数量中所占比重很小时，能够得到较大的TDF，从而能够得到较大的比重，有利于实现个性化的推荐。（

最低0.47元/天解锁文章

评论 1

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。