【发布时间】:2020-11-29 19:07:00
【问题描述】:
我有那个df:
gene person allele allele2
A1 p1 G C
A2 p1 A C
A3 p1 A T
A1 p2 G C
A2 p2 T T
A3 p2 G C
A4 p2 A T
A2 p1 G C
A3 p1 C C
...
如你所见,在表中我可以有同一个人几次(从不同的实验室记录)。第一个 p1 与第二个 p1 是不同的样本,我只需要选择得分最高(行数最高)的唯一样本,所以它是第一个 p1 的示例,因为它有 3,而另一个有 2。
而且我不知道如何提取该表以获得这样的结果:
gene person allele allele2
A1 p1 G C
A2 p1 A C
A3 p1 A T
A1 p2 G C
A2 p2 T T
A3 p2 G C
A4 p2 A T
...
我正在考虑通过 for 循环对其进行索引。例如,如果 person == above person,则添加到索引 i。如果没有,i+1。然后我会有一个小组。但是...整个 df 有 300 万行,所以在我开始之前,我决定在这里描述我的问题。也许这样做更好?
【问题讨论】:
标签: python pandas dataframe data-science