⚠申明: 未经许可,禁止以任何形式转载,若要引用,请标注链接地址。 全文共计5071字,阅读大概需要10分钟
🌈更多学习内容, 欢迎👏关注👀【文末】我的个人微信公众号:不懂开发的程序猿
⏰个人网站:https://jerry-jy.co/❗❗❗知识付费,🈲止白嫖,有需要请后台私信或【文末】个人微信公众号联系我
基于Python实现的简单电影推荐
基于Python实现的简单电影推荐
实验目录
- 基于Python实现的简单电影推荐
实验内容
- 基于Python实现的简单电影推荐
知识点
- 推荐系统采用这样一种统计算法,该算法基于实体之间的相似性或先前评估这些实体的用户之间的相似性来预测用户对特定实体的评级。直观上来讲就是相似类型的用户可能对同一组实体具有相似的评级。
实验目的
- 利用python完成基于电影评分之间相关性的推荐
实验环境
- Oracle Linux 7.4
- Python 3
任务实施过程
1.打开Jupyter,并新建python工程
-
桌面空白处右键,点击Konsole打开一个终端
-
切换至
/experiment/jupyter
目录
cd experiment/jupyter
- 启动Jupyter,root用户下运行需加
–allow-root
jupyter notebook --ip=127.0.0.1 --allow-root
- 依次点击右上角的 New,Python 3新建python工程
- 点击Untitled,在弹出框中修改标题名,点击Rename确认
2. 数据准备
- 输入代码后,使用shift+enter执行,下同。
- 导入所需库
import pandas as pd #读取csv数据
import numpy as np #进行数学运算
import warnings #屏蔽警告
import matplotlib.pyplot as plt #可视化
import seaborn as sns #可视化
warnings.filterwarnings('ignore')
- 导入数据并查看
ratings_data = pd.read_csv("/root/experiment/datas/ratings.csv") #导入
ratings_data.head() #查看数据前五行
movie_names = pd.read_csv("/root/experiment/datas/movies.csv")
movie_names.head() #查看数据前五行
- 数据集合并
movie_data = pd.merge(ratings_data, movie_names, on='movieId') #数据合并
movie_data.head() #查看数据前五行
3.数据分组查看
movie_data.groupby('title')['rating'].mean().head() #根据title特征分组并查看均值
movie_data.groupby('title')['rating'].mean().sort_values(ascending=False).head() #根据rating特征分组
movie_data.groupby('title')['rating'].count().sort_values(ascending=False).head()
4.建立DataFrame
ratings_mean_count = pd.DataFrame(movie_data.groupby('title')['rating'].mean()) #建立DataFrame格式
ratings_mean_count['rating_counts'] = pd.DataFrame(movie_data.groupby('title')['rating'].count()) #添加一列
ratings_mean_count.reset_index().head()
5.数据可视化
sns.set_style('dark')
plt.figure(figsize=(8,6)) #设置可视化参数
plt.rcParams['patch.force_edgecolor'] = True
ratings_mean_count['rating_counts'].hist(bins=50) #可视化
plt.figure(figsize=(8,6))
plt.rcParams['patch.force_edgecolor'] = True #可视化参数
ratings_mean_count['rating'].hist(bins=50) #可视化
plt.figure(figsize=(8,6))
plt.rcParams['patch.force_edgecolor'] = True #可视化参数
sns.jointplot(x='rating', y='rating_counts', data=ratings_mean_count, alpha=0.4) #可视化
6.建立透视表
user_movie_rating = movie_data.pivot_table(index='userId', columns='title', values='rating') #透视表
7.查看电影推荐
forrest_gump_ratings = user_movie_rating['Forrest Gump (1994)']
forrest_gump_ratings.head() #查看数据前五行
movies_like_forest_gump = user_movie_rating.corrwith(forrest_gump_ratings)
corr_forrest_gump = pd.DataFrame(movies_like_forest_gump, columns=['Correlation']) #建立DataFrame
corr_forrest_gump.dropna(inplace=True) #去掉空值
corr_forrest_gump.reset_index().head()
corr_forrest_gump.sort_values('Correlation', ascending=False).reset_index().head(10)
corr_forrest_gump = corr_forrest_gump.join(ratings_mean_count['rating_counts']) #合并
corr_forrest_gump.reset_index().head()
corr_forrest_gump[corr_forrest_gump ['rating_counts']>50].sort_values('Correlation', ascending=False).reset_index().head() #数据切片后查看前五行
数据集资源
链接: https://pan.baidu.com/s/1449wigKQrd2BrWUgrI90jw?pwd=2024
提取码: 2024
–end–
说明
本实验(项目)/论文若有需要,请后台私信或【文末】个人微信公众号联系我