【问题标题】:Remove duplicate rows of a CSV file based on a single column基于单个列删除 CSV 文件的重复行
【发布时间】:2022-01-02 23:18:54
【问题描述】:

我有一个 CSV 文件,其中有一列用作序列号。由于各种原因,序列号可以在行上重复,但我希望删除该序列号的最新列表以外的任何内容。

我想这对于 python/pandas 来说是可能的,因为如果整行是使用 pandas 的重复项,我目前已将其删除。这“几乎”可以满足我的需要,但如果我只能在与序列号的一列上匹配会更好。

目前看起来是这样的:

import pandas as pd
df = pd.read_csv('c:/LOG/NEWlog.csv')
df.drop_duplicates(inplace=True)
df.to_csv('c:/PDWLOG/NONDUPES.csv', index=False)

【问题讨论】:

    标签: python pandas csv duplicates


    【解决方案1】:

    试试这个:

    df.drop_duplicates(subset='serial column', inplace=True)
    

    【讨论】:

    • 啊,我现在在 pandas 文档中看到了该选项 - 谢谢!我明天试试看。
    猜你喜欢
    • 2015-12-28
    • 2017-05-24
    • 2022-01-24
    • 1970-01-01
    • 2021-12-18
    • 2016-02-13
    • 2019-01-16
    • 1970-01-01
    相关资源
    最近更新 更多