【Python】Pandas 的 apply 函数使用示例

最新推荐文章于 2025-10-11 11:07:19 发布

原创最新推荐文章于 2025-10-11 11:07:19 发布 · 9.6w 阅读

105 ·

CC 4.0 BY-SA版权

文章标签：

#python #数据分析 #Pandas

Python 同时被 2 个专栏收录

43 篇文章

订阅专栏

数据科学

14 篇文章

订阅专栏

本文介绍如何使用Pandas库解决两个具体问题：一是确定依据各州人口最多的三个县总和计算的三个最人口稠密的州；二是找出2010至2015年间人口变化最大的县。通过示例代码展示了apply和groupby函数的强大功能。

apply 是 pandas 库的一个很重要的函数，多和 groupby 函数一起用，也可以直接用于 DataFrame 和 Series 对象。主要用于数据聚合运算，可以很方便的对分组进行现有的运算和自定义的运算。
在这里插入图片描述

数据集

使用的数据集是美国人口普查的数据，可以从这里下载，里面包含了CSV数据文件和PDF说明文件，说明文件里解释了每个变量的意义。

数据大致是这个样子：

*美国人口普查数据*

问题

以每个州人口最多的 3 个县的人口总和为这个州人口的衡量标准，哪 3 个州人口最多？
在 2010 年至 2015 年间人口变化幅度最大的是哪个县？

分析

先按州分组，再对每个州内的县进行排序选出人口最多的 3 个县求和，作为每个州的人口数，最后排序。
对于每个县，计算 2010-2015 年的人口数的最大值和最小值，求出差值即变化幅度，再对差值进行排序找出变化幅度最大的县。

代码

问题1

census_df = pd.read_csv('census.csv')
only_county = census_df[census_df['SUMLEV'] == 50]


def top(df, n=3, column='CENSUS2010POP'):
    return df.sort_values(column, ascending=False)[:n]['CENSUS2010POP'].sum()


grouped = only_county[['STNAME', 'CTYNAME', 'CENSUS2010POP']].groupby('STNAME').apply(top)
grouped.sort_values(ascending=False)[:3].index.tolist()

输出：
在这里插入图片描述

问题2

census_df = pd.read_csv('census.csv')
only_county = census_df[census_df['SUMLEV'] == 50]


def get_change(row):
    pop_year = row[['POPESTIMATE2010', 
					'POPESTIMATE2011', 
					'POPESTIMATE2012', 
					'POPESTIMATE2013', 
					'POPESTIMATE2014', 
					'POPESTIMATE2015']]
    return pop_year.max() - pop_year.min()


only_county.loc[only_county.apply(get_change, axis=1).argmax()]['CTYNAME']