【发布时间】:2020-09-05 17:04:08
【问题描述】:
我有一个结构如下所示的文本文件,我想使用 python 提取数据框中的数据。数据框应具有 PMID 以及针对每个 PMID 的作者出现的所有文本。
数据格式
PMID- 唯一的 8 位数字
xyz - 文本(可能是多行)
xyz- 文本(可能是多行)
AUTHOR-文本(可能是多行)
作者- 文本(可能是多行)
PMID- 唯一的 8 位数字
xyz - 文本(可能是多行)
xyz- 文本(可能是多行)
AUTHOR-文本(可能是多行)
AUTHOR-文本(可能是多行)
我在 python 中尝试过的代码如下 - 我能够提取所有 PMID,但我无法弄清楚将所有作者文本附加到每个 PMID 的逻辑。
for lines in open('pubmed-cancerbiol.txt','r'):
if(lines[0:4] == 'PMID'):
print(lines)
【问题讨论】:
-
请用您尝试过的代码更新您的问题。
-
对不起,更新了我目前使用的代码,我更多的是在寻找一些关于逻辑的指导。一旦我得到逻辑,我就可以弄清楚代码。
标签: python dataframe data-processing