数据聚合
是数据处理阶段的最后一步,通常要使每一个数组生成一个单一的数值。
数据分类处理:
分组:先把数据分为几组
用函数处理:为不同组的数据应用不同的函数以转换数据
合并:把不同组得到的结果合并起来
数据分类处理的核心: groupby()函数
df=DataFrame({'color':['red','green','red','blue','green'],
'item':['pen','pencil','book','cup','watch'],
'price1':np.random.rand(5),
'price2':np.random.rand(5)})
df
如果使用color列索引,计算price1的均值,可以先获取到price1列,然后再调用groupby函数,用参数指定color这一列
.groupby('以其为索引的列名')['要计算的列名']
g=df.groupby('color')['price1']
g
将其整合之后,可以利用其实现各种操作:
g.sum() #求price的和
g.mean() #求price的平均值
g.max()
g.min()
======&#
数据分类处理:
分组:先把数据分为几组
用函数处理:为不同组的数据应用不同的函数以转换数据
合并:把不同组得到的结果合并起来
数据分类处理的核心: groupby()函数
df=DataFrame({'color':['red','green','red','blue','green'],
'item':['pen','pencil','book','cup','watch'],
'price1':np.random.rand(5),
'price2':np.random.rand(5)})
df
如果使用color列索引,计算price1的均值,可以先获取到price1列,然后再调用groupby函数,用参数指定color这一列
.groupby('以其为索引的列名')['要计算的列名']
g=df.groupby('color')['price1']
g
将其整合之后,可以利用其实现各种操作:
g.sum() #求price的和
g.mean() #求price的平均值
g.max()
g.min()
======&#