Python Pandas去重复数据drop

2023-12-19 03:23| 来源: 网络整理| 查看: 265

pandas.DataFrame.drop_duplicates DataFrame.drop_duplicates(subset=None, keep='first', inplace=False)

参数

subset：列标签，可选keep： {‘first’, ‘last’, False}, 默认值 ‘first’ first：保留第一次出现的重复项。last：删除重复项，仅保留最后一次出现的重复项。False：删除所有重复项。 inplace：布尔值，默认为False，是否删除重复项或返回副本

返回：重复数据删除： DataFrame

示例：

data = pd.DataFrame({'A':['a','b','c','c'],'B':[1,1,2,2]}) A B 0 a 1 1 b 1 2 c 2 3 c 2 data.drop_duplicates(subset=None,keep='first',inplace=True) A B 0 a 1 1 b 1 2 c 2 data.drop_duplicates(subset=['B'],keep='first',inplace=True) A B 0 a 1 2 c 2

subset=None表示考虑所有列，将这所以列对应值相同的行进行去重。默认值None。subset=[‘B’]表示只考虑’B’这列，将B列对应值相同的行进行去重。

keep='first’表示保留第一次出现的重复行，是默认值。keep另外两个取值为"last"和False，分别表示保留最后一次出现的重复行和去除所有重复行。

inplace=True表示直接在原来的DataFrame上删除重复项，而默认值False表示生成一个副本。

学习使我快乐

【本文地址】

公司简介

联系我们