【发布时间】:2013-12-10 12:52:46
【问题描述】:
给定一个数据框,我想获取重复的索引,这些索引在列中没有重复的值,并查看哪些值不同。
具体来说,我有这个数据框:
import pandas as pd
wget https://www.dropbox.com/s/vmimze2g4lt4ud3/alt_exon_repeatmasker_intersect.bed
alt_exon_repeatmasker = pd.read_table('alt_exon_repeatmasker_intersect.bed', header=None, index_col=3)
In [74]: alt_exon_repeatmasker.index.is_unique
Out[74]: False
并且有些索引在第 9 列有重复值(这个位置的 DNA 重复元素的类型),我想知道各个位置的重复元素的不同类型是什么(每个索引 = 一个基因组位置)。
我猜这需要某种groupby 并希望一些groupby ninja 可以帮助我。
为了进一步简化,如果我们只有索引和重复类型,
genome_location1 MIR3
genome_location1 AluJb
genome_location2 Tigger1
genome_location3 AT_rich
所以我想查看所有重复索引及其重复类型的输出,例如:
genome_location1 MIR3
genome_location1 AluJb
编辑:添加玩具示例
【问题讨论】:
-
嗨,通常最好的做法是尽可能简化问题并创建带有输入和所需输出的玩具示例。这样的问题得到了更快的回答,对未来的读者很有用。