TianChi新闻推荐02:多路召回+特征工程

最新推荐文章于 2022-02-18 15:27:24 发布

NLP_victor

最新推荐文章于 2022-02-18 15:27:24 发布

阅读量281

点赞数 1

分类专栏：数据竞赛文章标签：推荐系统

本文链接：https://blog.csdn.net/IOT_victor/article/details/110404404

版权

11 篇文章 2 订阅

订阅专栏

Task03 天池新闻推荐入门赛之【多路召回】

faiss工具包一般使用在推荐系统中的向量召回部分。

faiss使用了PCA和PQ(Product quantization乘积量化)两种技术进行向量压缩和编码，当然还使用了其他的技术进行优化，但是PCA和PQ是其中最核心部分。

冷启动问题可以分成三类：文章冷启动，用户冷启动，系统冷启动

文章冷启动：对于一个平台系统新加入的文章，该文章没有任何的交互记录，如何推荐给用户的问题。(对于我们场景可以认为是，日志数据中没有出现过的文章都可以认为是冷启动的文章)
用户冷启动：对于一个平台系统新来的用户，该用户还没有文章的交互信息，如何给该用户进行推荐。(对于我们场景就是，测试集中的用户是否在测试集对应的log数据中出现过，如果没有出现过，那么可以认为该用户是冷启动用户。但是有时候并没有这么严格，我们也可以自己设定某些指标来判别哪些用户是冷启动用户，比如通过使用时长，点击率，留存率等等)
系统冷启动：就是对于一个平台刚上线，还没有任何的相关历史数据，此时就是系统冷启动，其实也就是前面两种的一个综合。

多路召回合并

多路召回合并就是将前面所有的召回策略得到的用户文章列表合并起来，下面是对前面所有召回结果的汇总

注意：
在做召回评估的时候就会发现有些召回的效果不错有些召回的效果很差，所以对每一路召回的结果，我们可以认为的定义一些权重，来做最终的相似度融合

基于原始的给定数据，如下特征可以直接利用：

文章的自身特征， category_id表示这文章的类型， created_at_ts表示文章建立的时间，这个关系着文章的时效性， words_count是文章的字数，一般字数太长我们不太喜欢点击, 也不排除有人就喜欢读长文。
文章的内容embedding特征，这个召回的时候用过，这里可以选择使用，也可以选择不用，也可以尝试其他类型的embedding特征，比如W2V等
用户的设备特征信息

上面这些直接可以用的特征，待做完特征工程之后，直接就可以根据article_id或者是user_id把这些特征加入进去。但是我们需要先基于召回的结果，构造一些特征，然后制作标签，形成一个监督学习的数据集。

构造监督数据集的思路，

根据召回结果，我们会得到一个{user_id: [可能点击的文章列表]}形式的字典。
那么我们就可以对于每个用户，每篇可能点击的文章构造一个监督测试集，比如对于用户user1，假设得到的他的召回列表{user1: [item1, item2, item3]}，
我们就可以得到三行数据(user1, item1), (user1, item2), (user1, item3)的形式，这就是监督测试集时候的前两列特征。

构造特征的思路是这样，我们知道每个用户的点击文章是与其历史点击的文章信息是有很大关联的，比如同一个主题，相似等等。所以特征构造这块很重要的一系列特征是要结合用户的历史点击文章信息。

我们已经得到了每个用户及点击候选文章的两列的一个数据集，而我们的目的是要预测最后一次点击的文章，

所以我们就可以对于每个候选文章，做出与最后几次点击相关的特征如下：

当然，上面只是提供了一种基于用户历史行为做特征工程的思路，还可以一些其他的特征。下面我们就实现上面的这些特征的制作，下面的逻辑是这样：

关注