【发布时间】:2019-09-09 19:43:17
【问题描述】:
我的文件看起来像:
chr1:92092600 G[chr2:164084669[ ENSG00000189195 ENST00000342818 BTBD8 chr2:164084669
chr1:121498879 T[chr9:2781522[ ENSG00000233432 ENST00000425455 AL592494.2 chr9:2781522
chr2:101298260 ]chr3:196435392]A ENSG00000163162 ENST00000295317 RNF149 chr3:196435392
chr2:164084669 ]chr1:92092600]G ENSG00000237844 ENST00000429636 AC016766.1 chr1:92092600
chr9:2781522 ]chr1:121498879]T ENSG00000080608 ENST00000490444 PUM3 chr1:121498879
chr3:196435392 A[chr2:101298260[ ENSG00000163960 ENST00000296328 UBXN7 chr2:101298260
对于第 6 列中的每个元素,我想搜索第 1 列,如果存在 - 打印整行。因此,第 6 列中前 3 个元素的预期输出应如下所示:
chr2:164084669 ]chr1:92092600]G ENSG00000237844 ENST00000429636 AC016766.1 chr1:92092600
chr9:2781522 ]chr1:121498879]T ENSG00000080608 ENST00000490444 PUM3 chr1:121498879
chr3:196435392 A[chr2:101298260[ ENSG00000163960 ENST00000296328 UBXN7 chr2:101298260
到目前为止我有:
import pandas as pd
pd.options.display.max_colwidth = 100
file = open("data.txt", 'r')
chrA =[]
chrB = []
Bgenes = []
for line in file.readlines():
chrA.append(line.split()[0])
chrB.append(line.split()[5])
for pos in chrB:
if pos in chrA:
Bgenes.append(line)
【问题讨论】:
-
如果数据甚至没有进入数据框,为什么还要导入
pandas? -
也不是第6列的每个元素都在第1列吗?