Python Pandas去重复数据drop_duplicates详解

最新推荐文章于 2024-08-27 19:28:07 发布

搬砖的Fish

最新推荐文章于 2024-08-27 19:28:07 发布

阅读量4.2w

点赞数 27

分类专栏： Python 文章标签： python

本文链接：https://blog.csdn.net/Disany/article/details/82689948

版权

Python 专栏收录该内容

24 篇文章 3 订阅

订阅专栏

pandas.DataFrame.drop_duplicates

DataFrame.drop_duplicates(subset=None, keep='first', inplace=False)

参数

subset： 列标签，可选
keep： {‘first’, ‘last’, False}, 默认值 ‘first’
- first： 保留第一次出现的重复项。
- last： 删除重复项，仅保留最后一次出现的重复项。
- False： 删除所有重复项。
inplace：布尔值，默认为False，是否删除重复项或返回副本

返回：重复数据删除： DataFrame

示例：

data = pd.DataFrame({'A':['a','b','c','c'],'B':[1,1,2,2]})

	A	B
0	a	1
1	b	1
2	c	2
3	c	2

data.drop_duplicates(subset=None,keep='first',inplace=True)

	A	B
0	a	1
1	b	1
2	c	2

data.drop_duplicates(subset=['B'],keep='first',inplace=True)

	A	B
0	a	1
2	c	2

subset=None表示考虑所有列，将这所以列对应值相同的行进行去重。默认值None。subset=[‘B’]表示只考虑’B’这列，将B列对应值相同的行进行去重。

keep='first’表示保留第一次出现的重复行，是默认值。keep另外两个取值为"last"和False，分别表示保留最后一次出现的重复行和去除所有重复行。

inplace=True表示直接在原来的DataFrame上删除重复项，而默认值False表示生成一个副本。

学习使我快乐