【发布时间】:2016-07-18 19:54:29
【问题描述】:
如果有一个看起来像这样的python DataFrame:
ID_1 ID_2 haplotypeID locus
A1 A1 hap.1.1 KIRa
A1 A1 hap.1.2 KIRa
A2 A2 hap.2.1 KIRa
A2 A2 hap.2.2 KIRa
A3 A3 hap.1.1 KIRa
A4 A4 hap.2.2 KIRa
A4 A4 hap.1.2 KIRa
A1 A1 hap.1.1 KIRb
A2 A2 hap.2.1 KIRb
A2 A2 hap.2.2 KIRb
A3 A3 hap.1.1 KIRb
A3 A3 hap.1.2 KIRb
A4 A4 hap.2.2 KIRb
A4 A4 hap.1.2 KIRb
A1 A1 hap.1.1 KIRc
A2 A2 hap.2.1 KIRc
A3 A3 hap.1.1 KIRc
A3 A3 hap.1.2 KIRc
A4 A4 hap.1.2 KIRc
有 4 列命名:ID_1、ID_2、单倍型 ID 和基因座。 我想只保留 3 列 ID_1、ID_2 和轨迹重复的行对。在上面的示例中,输出将如下所示:
ID_1 ID_2 haplotypeID locus
A1 A1 hap.1.1 KIRa
A1 A1 hap.1.2 KIRa
A2 A2 hap.2.1 KIRa
A2 A2 hap.2.2 KIRa
A4 A4 hap.2.2 KIRa
A4 A4 hap.1.2 KIRa
A2 A2 hap.2.1 KIRb
A2 A2 hap.2.2 KIRb
A3 A3 hap.1.1 KIRb
A3 A3 hap.1.2 KIRb
A4 A4 hap.2.2 KIRb
A4 A4 hap.1.2 KIRb
A3 A3 hap.1.1 KIRc
A3 A3 hap.1.2 KIRc
我希望有人可以帮助我。提前谢谢!
【问题讨论】:
-
这表示在我想保留重复项时如何删除它们。我正在寻找的工具是“keep=False”。
标签: python pandas dataframe duplicates