【发布时间】:2013-11-14 19:18:05
【问题描述】:
我正在尝试使用 Biopython 的 Entrez.fetch() 函数通过基因 id (GI) 号从 NCBI 获取蛋白质序列。
proteina = Entrez.efetch(db="protein", id= gi, rettype="gb", retmode="xml").
然后我使用以下方法读取数据:
proteinaXML = Entrez.read(proteina).
我可以打印结果,但是我不知道如何单独获得蛋白质序列。
结果显示后,我可以手动到达蛋白质。或者我使用以下命令检查 XML 树:
proteinaXML[0]["GBSeq_feature-table"][2]["GBFeature_quals"][6]['GBQualifier_value'].
但是,根据提交的蛋白质的 GI,XML 树可能会有所不同。使这一过程难以稳健地自动化。
我的问题:是否可以只检索蛋白质序列,而不是整个 XML 树? 或者:如何从 XML 文件中提取蛋白质序列,因为 XML 文件的结构可能因蛋白质而异?
谢谢
【问题讨论】:
标签: xml sequence bioinformatics biopython ncbi