基于Python实现的简单电影推荐

⚠申明: 未经许可,禁止以任何形式转载,若要引用,请标注链接地址。 全文共计5071字,阅读大概需要10分钟
🌈更多学习内容, 欢迎👏关注👀【文末】我的个人微信公众号:不懂开发的程序猿
⏰个人网站:https://jerry-jy.co/

❗❗❗知识付费,🈲止白嫖,有需要请后台私信或【文末】个人微信公众号联系我

基于Python实现的简单电影推荐


实验目录

  1. 基于Python实现的简单电影推荐

实验内容

  1. 基于Python实现的简单电影推荐

知识点

  1. 推荐系统采用这样一种统计算法,该算法基于实体之间的相似性或先前评估这些实体的用户之间的相似性来预测用户对特定实体的评级。直观上来讲就是相似类型的用户可能对同一组实体具有相似的评级。

实验目的

  1. 利用python完成基于电影评分之间相关性的推荐

实验环境

  1. Oracle Linux 7.4
  2. Python 3

任务实施过程

1.打开Jupyter,并新建python工程

  1. 桌面空白处右键,点击Konsole打开一个终端

  2. 切换至/experiment/jupyter目录

cd experiment/jupyter
  1. 启动Jupyter,root用户下运行需加–allow-root
jupyter notebook --ip=127.0.0.1 --allow-root

在这里插入图片描述
在这里插入图片描述

  1. 依次点击右上角的 New,Python 3新建python工程

在这里插入图片描述

在这里插入图片描述

  1. 点击Untitled,在弹出框中修改标题名,点击Rename确认

在这里插入图片描述

2. 数据准备

  1. 输入代码后,使用shift+enter执行,下同。
  2. 导入所需库
import pandas as pd   #读取csv数据
import numpy as np   #进行数学运算
import warnings    #屏蔽警告
import matplotlib.pyplot as plt  #可视化
import seaborn as sns    #可视化
warnings.filterwarnings('ignore')

在这里插入图片描述

  1. 导入数据并查看
ratings_data = pd.read_csv("/root/experiment/datas/ratings.csv") #导入
ratings_data.head()  #查看数据前五行

在这里插入图片描述

movie_names = pd.read_csv("/root/experiment/datas/movies.csv")  
movie_names.head()   #查看数据前五行

在这里插入图片描述

  1. 数据集合并
movie_data = pd.merge(ratings_data, movie_names, on='movieId') #数据合并
movie_data.head()  #查看数据前五行

在这里插入图片描述

3.数据分组查看

movie_data.groupby('title')['rating'].mean().head() #根据title特征分组并查看均值

在这里插入图片描述

movie_data.groupby('title')['rating'].mean().sort_values(ascending=False).head()  #根据rating特征分组

在这里插入图片描述

movie_data.groupby('title')['rating'].count().sort_values(ascending=False).head()

在这里插入图片描述

4.建立DataFrame

ratings_mean_count = pd.DataFrame(movie_data.groupby('title')['rating'].mean()) #建立DataFrame格式
ratings_mean_count['rating_counts'] = pd.DataFrame(movie_data.groupby('title')['rating'].count()) #添加一列
ratings_mean_count.reset_index().head() 

在这里插入图片描述

5.数据可视化

sns.set_style('dark')  
plt.figure(figsize=(8,6))  #设置可视化参数
plt.rcParams['patch.force_edgecolor'] = True
ratings_mean_count['rating_counts'].hist(bins=50)  #可视化

在这里插入图片描述

plt.figure(figsize=(8,6))
plt.rcParams['patch.force_edgecolor'] = True   #可视化参数
ratings_mean_count['rating'].hist(bins=50)  #可视化

在这里插入图片描述

plt.figure(figsize=(8,6))
plt.rcParams['patch.force_edgecolor'] = True  #可视化参数
sns.jointplot(x='rating', y='rating_counts', data=ratings_mean_count, alpha=0.4)  #可视化

在这里插入图片描述

6.建立透视表

user_movie_rating = movie_data.pivot_table(index='userId', columns='title', values='rating')   #透视表

在这里插入图片描述

7.查看电影推荐

forrest_gump_ratings = user_movie_rating['Forrest Gump (1994)']
forrest_gump_ratings.head()  #查看数据前五行

在这里插入图片描述

movies_like_forest_gump = user_movie_rating.corrwith(forrest_gump_ratings)
corr_forrest_gump = pd.DataFrame(movies_like_forest_gump, columns=['Correlation'])   #建立DataFrame
corr_forrest_gump.dropna(inplace=True)  #去掉空值
corr_forrest_gump.reset_index().head()

在这里插入图片描述

corr_forrest_gump.sort_values('Correlation', ascending=False).reset_index().head(10)

在这里插入图片描述

corr_forrest_gump = corr_forrest_gump.join(ratings_mean_count['rating_counts'])  #合并
corr_forrest_gump.reset_index().head()

在这里插入图片描述

corr_forrest_gump[corr_forrest_gump ['rating_counts']>50].sort_values('Correlation', ascending=False).reset_index().head()  #数据切片后查看前五行

在这里插入图片描述

数据集资源

链接: https://pan.baidu.com/s/1449wigKQrd2BrWUgrI90jw?pwd=2024
提取码: 2024

–end–

说明

本实验(项目)/论文若有需要,请后台私信或【文末】个人微信公众号联系我

  • 31
    点赞
  • 18
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

不懂开发的程序猿

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值