基于Python实现的简单电影推荐

最新推荐文章于 2024-08-21 23:42:00 发布

不懂开发的程序猿

最新推荐文章于 2024-08-21 23:42:00 发布

阅读量798

点赞数 31

分类专栏：数据挖掘文章标签： python 数据库开发语言数据挖掘

本文链接：https://blog.csdn.net/qq_44807756/article/details/140134724

版权

数据挖掘专栏收录该内容

24 篇文章 0 订阅

订阅专栏

⚠申明：未经许可，禁止以任何形式转载，若要引用，请标注链接地址。全文共计5071字，阅读大概需要10分钟
🌈更多学习内容，欢迎👏关注👀【文末】我的个人微信公众号：不懂开发的程序猿
⏰个人网站：https://jerry-jy.co/

❗❗❗知识付费，🈲止白嫖，有需要请后台私信或【文末】个人微信公众号联系我

基于Python实现的简单电影推荐

实验目录

基于Python实现的简单电影推荐

实验内容

基于Python实现的简单电影推荐

知识点

推荐系统采用这样一种统计算法，该算法基于实体之间的相似性或先前评估这些实体的用户之间的相似性来预测用户对特定实体的评级。直观上来讲就是相似类型的用户可能对同一组实体具有相似的评级。

实验目的

利用python完成基于电影评分之间相关性的推荐

实验环境

Oracle Linux 7.4
Python 3

任务实施过程

1.打开Jupyter，并新建python工程

桌面空白处右键，点击Konsole打开一个终端
切换至/experiment/jupyter目录

cd experiment/jupyter

启动Jupyter，root用户下运行需加–allow-root

jupyter notebook --ip=127.0.0.1 --allow-root

在这里插入图片描述

依次点击右上角的 New，Python 3新建python工程

在这里插入图片描述

点击Untitled，在弹出框中修改标题名，点击Rename确认

在这里插入图片描述

2. 数据准备

输入代码后，使用shift+enter执行，下同。
导入所需库

import pandas as pd   #读取csv数据
import numpy as np   #进行数学运算
import warnings    #屏蔽警告
import matplotlib.pyplot as plt  #可视化
import seaborn as sns    #可视化
warnings.filterwarnings('ignore')

在这里插入图片描述

导入数据并查看

ratings_data = pd.read_csv("/root/experiment/datas/ratings.csv") #导入
ratings_data.head()  #查看数据前五行

在这里插入图片描述

movie_names = pd.read_csv("/root/experiment/datas/movies.csv")  
movie_names.head()   #查看数据前五行

在这里插入图片描述

数据集合并

movie_data = pd.merge(ratings_data, movie_names, on='movieId') #数据合并
movie_data.head()  #查看数据前五行

在这里插入图片描述

3.数据分组查看

movie_data.groupby('title')['rating'].mean().head() #根据title特征分组并查看均值

在这里插入图片描述

movie_data.groupby('title')['rating'].mean().sort_values(ascending=False).head()  #根据rating特征分组

在这里插入图片描述

movie_data.groupby('title')['rating'].count().sort_values(ascending=False).head()

在这里插入图片描述

4.建立DataFrame

ratings_mean_count = pd.DataFrame(movie_data.groupby('title')['rating'].mean()) #建立DataFrame格式
ratings_mean_count['rating_counts'] = pd.DataFrame(movie_data.groupby('title')['rating'].count()) #添加一列
ratings_mean_count.reset_index().head()

在这里插入图片描述

5.数据可视化

sns.set_style('dark')  
plt.figure(figsize=(8,6))  #设置可视化参数
plt.rcParams['patch.force_edgecolor'] = True
ratings_mean_count['rating_counts'].hist(bins=50)  #可视化

在这里插入图片描述

plt.figure(figsize=(8,6))
plt.rcParams['patch.force_edgecolor'] = True   #可视化参数
ratings_mean_count['rating'].hist(bins=50)  #可视化

在这里插入图片描述

plt.figure(figsize=(8,6))
plt.rcParams['patch.force_edgecolor'] = True  #可视化参数
sns.jointplot(x='rating', y='rating_counts', data=ratings_mean_count, alpha=0.4)  #可视化

在这里插入图片描述

6.建立透视表

user_movie_rating = movie_data.pivot_table(index='userId', columns='title', values='rating')   #透视表

在这里插入图片描述

7.查看电影推荐

forrest_gump_ratings = user_movie_rating['Forrest Gump (1994)']
forrest_gump_ratings.head()  #查看数据前五行

在这里插入图片描述

movies_like_forest_gump = user_movie_rating.corrwith(forrest_gump_ratings)
corr_forrest_gump = pd.DataFrame(movies_like_forest_gump, columns=['Correlation'])   #建立DataFrame
corr_forrest_gump.dropna(inplace=True)  #去掉空值
corr_forrest_gump.reset_index().head()

在这里插入图片描述

corr_forrest_gump.sort_values('Correlation', ascending=False).reset_index().head(10)

在这里插入图片描述

corr_forrest_gump = corr_forrest_gump.join(ratings_mean_count['rating_counts'])  #合并
corr_forrest_gump.reset_index().head()

在这里插入图片描述

corr_forrest_gump[corr_forrest_gump ['rating_counts']>50].sort_values('Correlation', ascending=False).reset_index().head()  #数据切片后查看前五行

在这里插入图片描述

数据集资源

链接: https://pan.baidu.com/s/1449wigKQrd2BrWUgrI90jw?pwd=2024
提取码: 2024

–end–

说明

本实验（项目）/论文若有需要，请后台私信或【文末】个人微信公众号联系我

不懂开发的程序猿

关注

31
点赞
踩
18

收藏

觉得还不错? 一键收藏
打赏
0
评论
基于Python实现的简单电影推荐

推荐系统采用这样一种统计算法，该算法基于实体之间的相似性或先前评估这些实体的用户之间的相似性来预测用户对特定实体的评级。直观上来讲就是相似类型的用户可能对同一组实体具有相似的评级。
复制链接

扫一扫