一位小白零基础入门新闻推荐Task05--【排序模型+融合模型】

最新推荐文章于 2024-10-18 00:00:00 发布

蒙拉

最新推荐文章于 2024-10-18 00:00:00 发布

阅读量133

点赞数

文章标签： python

本文链接：https://blog.csdn.net/weixin_45925255/article/details/110788485

版权

学习目标：

1、排序模型
2、模型融合

学习内容：

1、排序阶段选择了三个比较有代表性的排序模型：
LGB的排序模型
LGB的分类模型
深度学习的分类模型DIN
2、模型融合：加权融合

学习收获：

1、排序模型
通过召回的操作，进行了问题规模的缩减，对于每个用户，选择出了N篇文章作为了候选集，并基于召回的候选集构建了与用户历史相关的特征，以及用户本身的属性特征，文章本省的属性特征，以及用户与文章之间的特征，下面就是使用机器学习模型来对构造好的特征进行学习，然后对测试集进行预测，得到测试集中的每个候选集用户点击的概率，返回点击概率最大的topk个文章，作为最终的结果。
排序阶段选择了三个比较有代表性的排序模型，它们分别是：
LGB的排序模型
LGB的分类模型
深度学习的分类模型DIN
得到了最终的排序模型输出的结果之后，还选择了两种比较经典的模型集成的方法：
输出结果加权融合
Staking（将模型的输出结果再使用一个简单模型进行预测）

import numpy as np
import pandas as pd
import pickle
from tqdm import tqdm
import gc, os
import time
from datetime import datetime
import lightgbm as lgb
from sklearn.preprocessing import MinMaxScaler
import warnings
warnings.filterwarnings('ignore')

# 重新读取数据的时候，发现click_article_id是一个浮点数，所以将其转换成int类型
trn_user_item_feats_df = pd.read_csv(save_path + 'trn_user_item_feats_df.csv')
trn_user_item_feats_df['click_article_id'] = trn_user_item_feats_df['click_article_id'].astype(int)

if offline:
    val_user_item_feats_df = pd.read_csv(save_path + 'val_user_item_feats_df.csv')
    val_user_item_feats_df['click_article_id'] = val_user_item_feats_df['click_article_id'].astype(int)
else:
    val_user_item_feats_df = None
    
tst_user_item_feats_df = pd.read_csv(save_path + 'tst_user_item_feats_df.csv')
tst_user_item_feats_df['click_article_id'] = tst_user_item_feats_df['click_article_id'].astype(int)

# 做特征的时候为了方便，给测试集也打上了一个无效的标签，这里直接删掉就行
del tst_user_item_feats_df['label']