利用Python进行数据分析(14) pandas基础: 数据转换

640?wx_fmt=png

1. 移除重复数据

DataFrame里经常会出现重复行,DataFrame提供一个duplicated()方法检测各行是否重复,另一个drop_duplicates()方法用于丢弃重复行:

640?wx_fmt=png

duplicated()和drop_duplicates()方法默认判断全部列,如果不想这样,传入列的集合作为参数可以指定按列判断,例如:

640?wx_fmt=png

duplicated()和drop_duplicates()方法默认保留第一个出现的值,传入take_last=True保留最后一个值:

640?wx_fmt=png

2.利用映射进行数据转换

640?wx_fmt=png

3.DataFrame的povit方法

虽然这种存储格式对于关系型数据库是好的,不仅保持了关系完整性还提供了方便的查询支持。但是对于数据操作可能就不那么方便了,DataFrame的数据格式才更加方便。DataFrame的pivot方法提供了这个转换,例如:

640?wx_fmt=png

使用函数也能达到同样的效果:

640?wx_fmt=png

4.替换值

replace()方法用于替换:

640?wx_fmt=png

一次替换多个值:

640?wx_fmt=png

对不同的值进行不同的替换:

640?wx_fmt=png

5.DataFrame重命名轴索引

重命名列:

640?wx_fmt=png

重命名索引:

640?wx_fmt=png

6.将数据分成不同的组

640?wx_fmt=png

7.检测和过滤异常值

假设你有一组数据:

640?wx_fmt=png

找出绝对值大于2的值:

640?wx_fmt=png

找出绝对值大于2的行:

640?wx_fmt=png

将异常值设置为0:

640?wx_fmt=png

8.我的公众号

640?wx_fmt=png

博客
v8worker
05-08 2892
05-06 2871
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值