处理重复值

本例先用下面的代码导入示例文件“身份证号-去重.xlsx”中的数据。

import pandas as pd

df=pd.read_excel(io='D:\\身份证号-去重.xlsx',engine='openpyxl')

Document Image

进行去重,删除ID号重复的行数据。

参照前面各节的内容,打开“运行Python脚本”对话框,在“脚本”文本框中输入下面的代码。

code.python
dataset=dataset.drop_duplicates(subset=['工号'],keep='first',ignore_index=True)

如下图所示。

Document Image

单击“确定”按钮,去重结果如下图所示。

Document Image