panda用法

最新推荐文章于 2023-04-10 16:21:50 发布

HonourXin

最新推荐文章于 2023-04-10 16:21:50 发布

阅读量636

点赞数

分类专栏：机器学习文章标签： pandas

机器学习专栏收录该内容

7 篇文章 0 订阅

订阅专栏

数据提取
主要用到的三个函数：loc,iloc和ix，loc函数按标签值进行提取，iloc按位置进行提取，ix可以同时按标签和位置进行提取。

1、按索引提取单行的数值

df_inner.loc[3]

2、按索引提取区域行数值

df_inner.iloc[0:5]

3、重设索引

df_inner.reset_index()

4、设置日期为索引

df_inner=df_inner.set_index(‘date’)

5、提取4日之前的所有数据

df_inner[:’2013-01-04’]

6、使用iloc按位置区域提取数据

df_inner.iloc[:3,:2] #冒号前后的数字不再是索引的标签名称，而是数据所在的位置，从0开始，前三行，前两列。

7、适应iloc按位置单独提起数据

df_inner.iloc[[0,2,5],[4,5]] #提取第0、2、5行，4、5列

8、使用ix按索引标签和位置混合提取数据

df_inner.ix[:’2013-01-03’,:4] #2013-01-03号之前，前四列数据

9、判断city列的值是否为北京

df_inner[‘city’].isin([‘beijing’])

10、判断city列里是否包含beijing和shanghai，然后将符合条件的数据提取出来

df_inner.loc[df_inner[‘city’].isin([‘beijing’,’shanghai’])]

11、提取前三个字符，并生成数据表

pd.DataFrame(category.str[:3])

六、数据筛选
使用与、或、非三个条件配合大于、小于、等于对数据进行筛选，并进行计数和求和。

1、使用“与”进行筛选

df_inner.loc[(df_inner[‘age’] > 25) & (df_inner[‘city’] == ‘beijing’), [‘id’,’city’,’age’,’category’,’gender’]]

2、使用“或”进行筛选

df_inner.loc[(df_inner[‘age’] > 25) | (df_inner[‘city’] == ‘beijing’), [‘id’,’city’,’age’,’category’,’gender’]].sort([‘age’])

3、使用“非”条件进行筛选
df_inner.loc[(df_inner[‘city’] != ‘beijing’), [‘id’,’city’,’age’,’category’,’gender’]].sort([‘id’])

4、对筛选后的数据按city列进行计数
df_inner.loc[(df_inner[‘city’] != ‘beijing’), [‘id’,’city’,’age’,’category’,’gender’]].sort([‘id’]).city.count()

5、使用query函数进行筛选
df_inner.query(‘city == [“beijing”, “shanghai”]’)

6、对筛选后的结果按prince进行求和
df_inner.query(‘city == [“beijing”, “shanghai”]’).price.sum()

七、数据汇总
主要函数是groupby和pivote_table

1、对所有的列进行计数汇总
df_inner.groupby(‘city’).count()

2、按城市对id字段进行计数
df_inner.groupby(‘city’)[‘id’].count()

3、对两个字段进行汇总计数
df_inner.groupby([‘city’,’size’])[‘id’].count()

4、对city字段进行汇总，并分别计算prince的合计和均值
df_inner.groupby(‘city’)[‘price’].agg([len,np.sum, np.mean])

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
panda用法

数据提取主要用到的三个函数：loc,iloc和ix，loc函数按标签值进行提取，iloc按位置进行提取，ix可以同时按标签和位置进行提取。1、按索引提取单行的数值df_inner.loc[3]2、按索引提取区域行数值df_inner.iloc[0:5]3、重设索引df_inner.reset_index()4、设置日期为索引df_inner=df_inner.set_index(...
复制链接

扫一扫

专栏目录

HonourXin CSDN认证博客专家 CSDN认证企业博客

码龄6年

17: 原创

107万+: 周排名

146万+: 总排名

7224: 访问

: 等级

228: 积分

3: 粉丝

4: 获赞

1: 评论

21: 收藏

私信

关注

热门文章

分类专栏

最新评论

树模型从决策树到RF再到XGB
HonourXin: https://zhuanlan.zhihu.com/p/82521899

您愿意向朋友推荐“博客详情页”吗？

强烈不推荐
不推荐
一般般
推荐
强烈推荐

提交

最新文章

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。