Python-如何使用PivotTable（透视表）

最新推荐文章于 2024-06-22 15:42:30 发布

置顶 youyouxiong

最新推荐文章于 2024-06-22 15:42:30 发布

阅读量5.4k

点赞数 2

分类专栏： python

本文链接：https://blog.csdn.net/youyouxiong/article/details/118267747

版权

python 专栏收录该内容

15 篇文章 3 订阅

订阅专栏

也许大多数人都有在Excel中使用数据透视表的经历，其实Pandas也提供了一个类似的功能，名为pivot_table。虽然pivot_table非常有用，但是我发现为了格式化输出我所需要的内容，经常需要记住它的使用语法。所以，本文将重点解释pandas中的函数pivot_table，并教大家如何使用它来进行数据分析。

如果你对这个概念不熟悉，wikipedia上对它做了详细的解释。顺便说一下，你知道微软为PivotTable（透视表）注册了商标吗？其实以前我也不知道。不用说，下面我将讨论的透视表并不是PivotTable。

作为一个额外的福利，我创建了一个总结pivot_table的简单备忘单。你可以在本文的最后找到它，我希望它能够对你有所帮助。如果它帮到了你，请告诉我。

数据

使用pandas中pivot_table的一个挑战是，你需要确保你理解你的数据，并清楚地知道你想通过透视表解决什么问题。其实，虽然pivot_table看起来只是一个简单的函数，但是它能够快速地对数据进行强大的分析。

在本文中，我将会跟踪一个销售渠道（也称为漏斗）。基本的问题是，一些销售周期很长（可以想一下“企业软件”、“资本设备”等），而管理者想更详细地了解它一整年的情况。

典型的问题包括：

本渠道收入是多少？
渠道的产品是什么？
谁在什么阶段有什么产品？
我们年底前结束交易的可能性有多大？

很多公司将会使用CRM工具或者其他销售使用的软件来跟踪此过程。虽然他们可能拥有有效的工具对数据进行分析，但肯定有人需要将数据导出到Excel，并使用一个透视表工具来总结这些数据。

使用Pandas透视表将是一个不错的选择，应为它有以下优点：

更快（一旦设置之后）
自行说明（通过查看代码，你将知道它做了什么）
易于生成报告或电子邮件
更灵活，因为你可以定义定制的聚合函数

Read in the data

首先，让我们搭建所需的环境。

如果你想跟随我继续下去，那么可以下载这个Excel文件。

Python

import pandas as pd
import numpy as np

版本提醒

因为Pivot_table API已经随着时间有所改变，所以为了使本文中示例代码能够正常工作，请确保你安装了最近版本的Pandas（>0.15）。本文示例还用到了category数据类型，而它也需要确保是最近版本。

首先，将我们销售渠道的数据读入到数据帧中。

df = pd.read_excel("../in/sales-funnel.xlsx")
df.head()

为方便起见，我们将上表中“Status”列定义为category，并按我们想要的查看方式设置顺序。

其实，并不严格要求这样做，但这样做能够在分析数据的整个过程中，帮助我们保持所想要的顺序。

df["Status"] = df["Status"].astype("category")
df["Status"].cat.set_categories(["won","pending","presented","declined"],inplace=True)

处理数据

既然我们建立数据透视表，我觉得最容易的方法就是一步一个脚印地进行。添加项目和检查每一步来验证你正一步一步得到期望的结果。为了查看什么样的外观最能满足你的需要，就不要害怕处理顺序和变量的繁琐。

最简单的透视表必须有一个数据帧和一个索引。在本例中，我们将使用“Name（名字）”列作为我们的索引。

pd.pivot_table(df,index=["Name"])

此外，你也可以有多个索引。实际上，大多数的pivot_table参数可以通过列表获取多个值。

pd.pivot_table(df,index=["Name","Rep","Manager"])

这样很有趣但并不是特别有用。我们可能想做的是通过将“Manager”和“Rep”设置为索引来查看结果。要实现它其实很简单，只需要改变索引就可以。

pd.pivot_table(df,index=["Manager","Rep"])

可以看到，透视表比较智能，它已经开始通过将“Rep”列和“Manager”列进行对应分组，来实现数据聚合和总结。那么现在，就让我们共同看一下数据透视表可以为我们做些什么吧。

为此，“Account”和“Quantity”列对于我们来说并没什么用。所以，通过利用“values”域显式地定义我们关心的列，就可以实现移除那些不关心的列。

pd.pivot_table(df,index=["Manager","Rep"],values=["Price"])

“Price”列会自动计算数据的平均值，但是我们也可以对该列元素进行计数或求和。要添加这些功能，使用aggfunc和np.sum就很容易实现。

pd.pivot_table(df,index=["Manager","Rep"],values=["Price"],aggfunc=np.sum)

aggfunc可以包含很多函数，下面就让我们尝试一种方法，即使用numpy中的函数mean和len来进行计数。

在此，楼主恬不知耻地推荐微信公众号「Python极客思维」，公众号内会持续发布大厂各种高薪岗位，包括但不限于Python岗位（内推哦），欢迎诸位老铁切磋交流~~。

微信扫描下方二维码，获取详细PDF版答案。并且回复Python面试题

youyouxiong

关注

2
点赞
踩
6

收藏

觉得还不错? 一键收藏
打赏
1
评论
Python-如何使用PivotTable（透视表）

也许大多数人都有在Excel中使用数据透视表的经历，其实Pandas也提供了一个类似的功能，名为pivot_table。虽然pivot_table非常有用，但是我发现为了格式化输出我所需要的内容，经常需要记住它的使用语法。所以，本文将重点解释pandas中的函数pivot_table，并教大家如何使用它来进行数据分析。如果你对这个概念不熟悉，wikipedia上对它做了详细的解释。顺便说一下，你知道微软为PivotTable（透视表）注册了商标吗？其实以前我也不知道。不用说，下面我将讨论的透视表并不是P
复制链接

扫一扫