对MovieLens 数据集进行评分预测-ALS 与 Surprise 工具的使用-详细解释
理论基础
surprise 用途
这个库用来做MF(矩阵分解)
surprise 中的常用算法
- Baseline 算法
- 基于邻域的协同过滤
- 矩阵分解:SVD, SVD++,PMF,NMF
- slopeOne 协同过滤算法
关于surprise 使用方法的说明
surprise 推荐系统工具算法描述
model_selection 包
项目解析
BaslineOnly
算法理论部分
基准算法包含两个主要的算法NormalPredictor和BaselineOnly。
BaselineOnly 是基于统计的基准预测线打分,思想是设立基线,并引入user的偏差以及item的偏差。
μ为所有用户对电影评分的均值
bui:待求的基线模型中用户u给物品i打分的预估值
bu:user偏差(如果用户比较苛刻,打分都相对偏低, 则bu<0;反之,bu>0);
bi为item偏差,反映商品受欢迎程度
Baselines can be estimated in two different ways:
-Using Stochastic Gradient Descent (SGD).
-Using Alternating Least Squares (ALS).
代码讲解
#from surprise import SVD
from surprise import Dataset
from surprise import Reader
from surprise import BaselineOnly, KNNBasic, NormalPredictor
from surprise import accuracy
from surprise.model_selection import KFold
#import pandas as pd
# 数据读取,先定义一个读取器,以','分隔,第一行跳过
reader = Reader(line_format='user item rating timestamp', sep=',', skip_lines