利用Python进行进行数据分析3-数据规整之聚合、合并和重塑

本文介绍了Python数据分析中层次化索引的重要性和使用,包括如何创建和操作MultiIndex,以及数据的重塑、合并和旋转。通过实例展示了如何使用`set_index`、`unstack`、`stack`、`merge`和`pivot`等方法进行数据的规整,强调了这些操作在数据处理中的灵活性和实用性。
摘要由CSDN通过智能技术生成

层次化索引

层次化索引(hierarchical indexing)是pandas的⼀项重要功能,它使你能在⼀个轴上拥有多个(两个以上)索引级别。抽象点说,它使你能以低维度形式处理⾼维度数据。
我们先来看⼀个简单的例⼦:创建⼀个Series,并⽤⼀个由列表或数组组成的列表作为索引:

import numpy as np
import pandas as pd
pd.options.display.max_rows = 20
np.random.seed(12345)
import matplotlib.pyplot as plt
plt.rc('figure', figsize=(10, 6))
np.set_printoptions(precision=4, suppress=True)
data = pd.Series(np.random.randn(9),
                 index=[['a', 'a', 'a', 'b', 'b', 'c', 'c', 'd', 'd'],
                        [1, 2, 3, 1, 3, 1, 2, 2, 3]])
data

在这里插入图片描述
看到的结果是经过美化的带有MultiIndex索引的Series的格式。索引之间的“间隔”表示“直接使⽤上⾯的标签”:

data.index

在这里插入图片描述
对于⼀个层次化索引的对象,可以使⽤所谓的部分索引,使⽤它选取数据⼦集的操作更简单:

#索引
data['b']

在这里插入图片描述

data['b':'c']

在这里插入图片描述

data.loc[['b', 'd']]

在这里插入图片描述
有时甚⾄还可以在“内层”中进⾏选取:

#内层索引
data.loc[:, 2]

在这里插入图片描述
层次化索引在数据重塑和基于分组的操作(如透视表⽣成)中扮演着重要的⻆⾊。
例如,可以通过unstack⽅法将这段数据重新安排到⼀个DataFrame中:

#unstack⽅法将这段数据重新安排到⼀个DataFrame
data.unstack()

在这里插入图片描述
unstack的逆运算是stack:

#unstack的逆运算
data.unstack().stack()

在这里插入图片描述
stack和unstack将在后⾯详细讲解。
对于⼀个DataFrame,每条轴都可以有分层索引:

#每条轴都可以有分层索引
frame = pd.DataFrame(np.arange(12).reshape((4, 3)),
                     index=[['a', 'a', 'b', 'b'], [1, 2, 1, 2]],
                     columns=[['Ohio', 'Ohio', 'Colorado'],
                              ['Green', 'Red', 'Green']])
frame

在这里插入图片描述
各层都可以有名字(可以是字符串,也可以是别的Python对象)。如果指定了名称,它们就会显示在控制台输出中:

#指定了名称
frame.index.names = ['key1', 'key2']
frame.columns.names = ['state', 'color']
frame

在这里插入图片描述
有了部分列索引,因此可以轻松选取列分组:

frame['Ohio']

在这里插入图片描述
可以单独创建MultiIndex然后复⽤。上⾯那个DataFrame中的(带有分级名称)列可以这样创建:
PS:原书中的代码无法运行,此处稍有改动。

pd.MultiIndex.from_arrays([['Ohio', 'Ohio', 'Colorado'], ['Green', 'Red', 'Green']],
                       names=['state', 'color'])

在这里插入图片描述

重排与分级排序

有时,你需要重新调整某条轴上各级别的顺序,或根据指定级别上的值对数据进⾏排序。swaplevel接受两个级别编号或名称,并返回⼀个互换了级别的新对象(但数据不会发⽣变化):

#交换
frame.swaplevel('key1', 'key2')

在这里插入图片描述
⽽sort_index则根据单个级别中的值对数据进⾏排序。交换级别时,常常也会⽤到sort_index,这样最终结果就是按照指定顺序进⾏字⺟排序了:

#排序
frame.sort_index(level=1)

在这里插入图片描述

frame.swaplevel(0, 1).sort_index(level=0)

在这里插入图片描述

根据级别汇总统计

许多对DataFrame和Series的描述和汇总统计都有⼀个level选项,它⽤于指定在某条轴上求和的级别。再以上⾯那个DataFrame为例,我们可以根据⾏或列上的级别来进⾏求和:

#汇总统计
frame.sum(level='key2')

在这里插入图片描述

frame.sum(level='color', axis=1)

在这里插入图片描述
这其实是利⽤了pandas的groupby功能,稍后将对其进⾏详细讲解。

使⽤DataFrame的列进⾏索引

⼈们经常想要将DataFrame的⼀个或多个列当做⾏索引来⽤,或者可能希望将⾏索引变成DataFrame的列。以下⾯这个DataFrame为例:

frame = pd.DataFrame({
   'a': range(7), 'b': range(7, 0, -1),
                      'c': ['one', 'one', 'one', 'two', 'two',
                            'two', 'two'],
                      'd': [0, 1, 2, 0, 1, 2, 3]})
frame

在这里插入图片描述
DataFrame的set_index函数会将其⼀个或多个列转换为⾏索引,并创建⼀个新的DataFrame:

#会将其⼀个或多个列转换为⾏索引
frame2 = frame.set_index(['c', 'd'])
frame2

在这里插入图片描述
默认情况下,那些列会从DataFrame中移除,但也可以将其保留下来:

#保留索引列
frame.set_index(['c', 'd'], drop=False)

在这里插入图片描述
reset_index的功能跟set_index刚好相反,层次化索引的级别会被转移到列⾥⾯:

frame2.reset_index()

在这里插入图片描述

合并数据集

pandas对象中的数据可以通过⼀些⽅式进⾏合并:

  1. pandas.merge可根据⼀个或多个键将不同DataFrame中的⾏连接起来。SQL或其他关系型数据库的⽤户对此应该会⽐较熟悉,因为它实现的就是数据库的join操作。
  2. pandas.concat可以沿着⼀条轴将多个对象堆叠到⼀起。实例⽅法combine_first可以将重复数据编接在⼀起,⽤⼀个对象中的值填充另⼀个对象中的缺失值。

数据库风格的DataFrame合并

数据集的合并(merge)或连接(join)运算是通过⼀个或多个键将⾏链接起来的。这些运算是关系型数据库(基于SQL)的核⼼。pandas的merge函数是对数据应⽤这些算法的主要切⼊点。
以⼀个简单的例⼦开始:

df1 = pd.DataFrame({
   'key': ['b', 'b', 'a', 'c', 'a', 'a', 'b'],
                    'data1': range(7)})
df2 = pd.Da
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值