Python数据分析 | (25) 层次化索引

在许多应用中,数据可能分散在许多文件或数据库中,存储的形式也不利于分析。接下来的几篇博客将关注可以聚合、合并、重塑数据的方法。

首先,我会介绍pandas的层次化索引,它广泛用于以上操作。然后,我将深入介绍了一些特殊的数据操作。在之后的博客中,你可以看到这些工具的多种应用。

目录

1. 层次化索引

2. 重排与分级排序

3. 根据级别汇总统计

4. 使用DataFrame的列进行索引


1. 层次化索引

层次化索引(hierarchical indexing)是pandas的一项重要功能,它使你能在 一个轴上拥有多个(两个以上)索引级别。抽象点说,它使你能以低维度形 式处理高维度数据。我们先来看一个简单的例子:创建一个Series,并用一 个由列表或数组组成的列表作为索引:

import numpy as np
import pandas as pd
pd.options.display.max_rows = 20
np.random.seed(12345)
import matplotlib.pyplot as plt
plt.rc('figure', figsize=(10, 6))
np.set_printoptions(precision=4, suppress=True)
data = pd.Series(np.random.randn(9),
                 index=[['a', 'a', 'a', 'b', 'b', 'c', 'c', 'd', 'd'],
                        [1, 2, 3, 1, 3, 1, 2, 2, 3]])
data

看到的结果是经过美化的带有MultiIndex索引的Series的格式。索引之间 的“间隔”表示“直接使用上面的标签”:

data.index

对于一个层次化索引的对象,可以使用所谓的部分索引,使用它选取数据子集的操作更简单:

print(data['b'])
print("----------------")
print(data['b':'c'])
print("----------------")
print(data.loc[['b', 'd']])

有时甚至还可以在“内层”中进行选取:

data.loc[:, 2]

层次化索引在数据重塑和基于分组的操作(如透视表生成)中扮演着重要的 角色。例如,可以通过unstack方法将这段数据重新安排到一个DataFrame中:

data.unstack()

data.unstack().stack()

unstack的逆运算是stack: 

stack和unstack将在后续博客中详细讲解。

对于一个DataFrame,每条轴都可以有分层索引:

frame = pd.DataFrame(np.arange(12).reshape((4, 3)),
                     index=[['a', 'a', 'b', 'b'], [1, 2, 1, 2]],
                     columns=[['Ohio', 'Ohio', 'Colorado'],
                              ['Green', 'Red', 'Green']])
frame

各层都可以有名字(可以是字符串,也可以是别的Python对象)。如果指定 了名称,它们就会显示在控制台输出中:

frame.index.names = ['key1', 'key2']
frame.columns.names = ['state', 'color']
frame

小心区分索引名state、color与行标签。

有了部分列索引,因此可以轻松选取列分组:

frame['Ohio']

可以单独创建MultiIndex然后复用。上面那个DataFrame中的(带有分级名 称)列可以这样创建:

MultiIndex.from_arrays([['Ohio', 'Ohio', 'Colorado'], ['Green', 'Red', 'Green']],
                       names=['state', 'color'])

2. 重排与分级排序

有时,你需要重新调整某条轴上各级别的顺序,或根据指定级别上的值对数 据进行排序。swaplevel接受两个级别编号或名称,并返回一个互换了级别的 新对象(但数据不会发生变化):

frame.swaplevel('key1', 'key2')

而sort_index则根据单个级别中的值对数据进行排序。交换级别时,常常也 会用到sort_index,这样最终结果就是按照指定顺序进行字母排序了:

frame.sort_index(level=1)

frame.swaplevel(0, 1).sort_index(level=0)

3. 根据级别汇总统计

许多对DataFrame和Series的描述和汇总统计都有一个level选项,它用于指 定在某条轴上求和的级别。再以上面那个DataFrame为例,我们可以根据行 或列上的级别来进行求和:

frame.sum(level='key2') #默认axis=0

frame.sum(level='color', axis=1)

这其实是利用了pandas的groupby功能,后续将对其进行详细讲解。

 

4. 使用DataFrame的列进行索引

人们经常想要将DataFrame的一个或多个列当做行索引来用,或者可能希望 将行索引变成DataFrame的列。以下面这个DataFrame为例:

frame = pd.DataFrame({'a': range(7), 'b': range(7, 0, -1),
                      'c': ['one', 'one', 'one', 'two', 'two',
                            'two', 'two'],
                      'd': [0, 1, 2, 0, 1, 2, 3]})
frame

DataFrame的set_index函数会将其一个或多个列转换为行索引,并创建一个 新的DataFrame:

frame2 = frame.set_index(['c', 'd'])
frame2

默认情况下,那些列会从DataFrame中移除,但也可以将其保留下来:

frame.set_index(['c', 'd'], drop=False)

reset_index的功能跟set_index刚好相反,层次化索引的级别会被转移到列里 面:

print(frame2)
print("--------")
frame2.reset_index()

 

 

 

 

 

 

评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值