作业一:历年500强企业行业分布(考察数据透视表的使用 )
import pandas as pd
import matplotlib.pyplot as plt
import seaborn as sns
plt.rcParams[‘font.sans-serif’] = [‘SimHei’]
plt.rcParams[‘axes.unicode_minus’] = False
sns.set(font=‘SimHei’)
df = pd.read_csv(“D:/数据文件/Fortune500-China.csv”,encoding=‘gb2312’, usecols=[“Year”, “Company”, “Industry”])
#根据’Year’,'Industry’分组统计值
df = df.groupby([‘Year’,‘Industry’]).size().reset_index(name=‘count’)
dfcount=pd.pivot_table(df, index=[‘Industry’], columns=‘Year’, values= “count”)
dfcount
使用 jupyter notebook执行效果(核心要点:使用pivot_table分组统计后行转列显示)
作业二:2020年中国500强企业最多的15个行业
#1、导入可视化库,并设置中文字体 (matplotlib 作条形图)
im