pandas - 分组与聚合

最新推荐文章于 2023-11-06 17:32:55 发布

梦因you而美

最新推荐文章于 2023-11-06 17:32:55 发布

阅读量1.1k

点赞数

分类专栏：数据挖掘文章标签：分组与聚合 pandas

本文链接：https://blog.csdn.net/apollo_miracle/article/details/88419414

版权

数据挖掘专栏收录该内容

44 篇文章 4 订阅

订阅专栏

学习目标

应用groupby和聚合函数实现数据的分组与聚合
应用：星巴克零售店数据的分组与聚合

分组与聚合通常是分析数据的一种方式，通常与一些统计函数一起使用，查看数据的分组情况

想一想其实刚才的交叉表与透视表也有分组的功能，所以算是分组的一种形式，只不过他们主要是计算次数或者计算比例！！

1 什么分组与聚合

2 通过一个例子来理解分组聚合

2.1 不同颜色的不同笔的价格数据

col =pd.DataFrame({'color': ['white','red','green','red','green'], 'object': ['pen','pencil','pencil','ashtray','pen'],'price1':[5.56,4.20,1.30,0.56,2.75],'price2':[4.75,4.12,1.60,0.75,3.15]})

2.2 分组API

DataFrame.groupby(key, as_index=False)
- key:分组的列数据，可以多个

# 分组，求平均值
col.groupby(['color'])['price1'].mean()
col['price1'].groupby(col['color']).mean()

# 分组，数据的结构不变
col.groupby(['color'], as_index=False)['price1'].mean()

3 星巴克零售店面数据

现在我们有一组关于全球星巴克店铺的统计数据，如果我想知道美国的星巴克数量和中国的哪个多，或者我想知道中国每个省份星巴克的数量的情况，那么应该怎么办？

数据来源：https://www.kaggle.com/starbucks/store-locations/data

3.1 数据获取

# 导入星巴克店的数据
starbucks = pd.read_csv("./data/starbucks/directory.csv")

3.2 进行分组聚合

# 按照国家分组，求出每个国家的星巴克零售店数量
count = starbucks.groupby(['Country']).count()

画图显示结果

count['Brand'].plot(kind='bar', figsize=(20, 8))
plt.show()

假设我们加入省市一起进行分组

# 设置多个索引，set_index()
starbucks.groupby(['Country', 'State/Province']).count()

仔细观察这个结构，与我们前面讲的哪个结构类似？？

MultiIndex

梦因you而美

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
pandas - 分组与聚合

学习目标应用groupby和聚合函数实现数据的分组与聚合应用：星巴克零售店数据的分组与聚合分组与聚合通常是分析数据的一种方式，通常与一些统计函数一起使用，查看数据的分组情况想一想其实刚才的交叉表与透视表也有分组的功能，所以算是分组的一种形式，只不过他们主要是计算次数或者计算比例！！1 什么分组与聚合2 通过一个例子来理解分组聚合2.1 不同颜色的不同笔的价格数据...
复制链接

扫一扫

专栏目录