使用pandas处理数据

使用pandas处理大型数据方法来统计数据

下图为使用爬虫爬取豆瓣美国英国中国的电视剧信息
在这里插入图片描述
要求获得每一个国家的电视剧数量,因此需要数据分析,使用pandas方法进行处理,思路为构造一个全为0的数组,然后循环遍历,将属于每一个类别的电影设为1
import pandas as pd

df = pd.read_csv(.//douban.csv) #pandas方法读取csv文件也可是txt或别的
temp_list = df[“country”].tolist() # 每个电影的国家列表
country_list = list(set([i for i in temp_list])) # 总共有的电影分类
zeros_df = pd.DataFrame(np.zeros((df.shape[0], len(country_list))), columns=country_list) # 构造一个全为0的数组
构造的
#遍历每一个电影 数据过多的时候速度很慢,当数据多达几万几十万时不推荐该方法
for country in country_list:
zeros_df[country].str.contains(country)] = 1
print(zeros_df)

#或者遍历三个国家 速度很快
for i in range(df.shape[0]): # 给每个电影出现的分类赋值1
zeros_df.loc[i, temp_list[i]] = 1
print(zeros_df)
在这里插入图片描述

按行统计每个国家电影的数目axis=0是跨行统计 axis=1是跨列进行统计

counts = zeros_df.sum(axis=0)
print(counts)
在这里插入图片描述
绘制条形图
_x = counts.index x轴
_y = counts.values y轴
plt.figure(figsize=(20, 8), dpi=80) 设置图形大小
plt.bar(range(len(_x)), _y, width=0.3, color=“orange”) 设置条形图
plt.xticks(range(len(_x)), _x) 设置x轴刻度
plt.show()
在这里插入图片描述

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 1
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值