pandas处理mysql案例_使用pandas模块帮助朋友处理mysql中的重复数据

最新推荐文章于 2023-03-02 18:23:53 发布

金大发

最新推荐文章于 2023-03-02 18:23:53 发布

阅读量314

点赞数

文章标签： pandas处理mysql案例

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_42429956/article/details/113286882

版权

接到朋友求助，说自己一个数据库里的某个表有大量重复数据，使用mysql语句处理的速度太慢，每次只能处理1W条数据，总共800W条数据需要处理，耗时耗力。分开处理也会有大量的遗漏数据需要二次三次处理，最后得到的数据还是会不准确，很显然用mysql语句处理不怎么好。

我想到了python中有一个模块pandas是专门用来处理海量数据的，马上网上查下该模块是否有相关的方法，果然，pandas里的drop_duplicates方法就是用来去除重复数据的，并且该方法还提供了多个参数。

朋友的需求为数据库表里的某个字段的记录不能重复，如果重复则保留最新的数据。需求已经明白，马上开始动工。

使用Navicat 先将数据库里的需要处理的表同步到本地，然后在本地操作。

直接上代码

import pymysql

import pandas as pda

conn=pymysql.connect(host="127.0.0.1",user="root",passwd="pw",db="test001",charset="utf8")

sql="select * from table001"

data1 = pda.read_sql(sql,conn)

print(data1.count())

data2 = data1.drop_duplicates(subset="big",keep="last")

data2.to_sql("table002",con=conn,flavor="mysql",if_exists="append",index=False)

print(data2.count())

table001表为原始表,big为表里不能重复的字段，keep="last"代表留重复数据的最后一条，table002表为清洗完数据保存数据的表。

运行该脚本，十来分钟左右，800W条数据已经全部清洗完毕，还剩余200W条不重复数据，并且还和朋友正确的数据一条不差。

随后将数据表上传至朋友的线上服务器，朋友验证数据都没问题。

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。