【问题标题】:similarity of genes given gene name, in BioPythonBioPython中给定基因名称的基因的相似性
【发布时间】:2013-12-26 03:28:01
【问题描述】:

给定基因名称,我如何找到两个基因的相似性? 通过相似性,我认为我的意思是序列的相似性。我是这个领域的新手,并由我的教授完成了这项工作。我不知道很多类型的相似性

希望,这可以用 Biopython 完成吗?

非常感谢。

更新为响应:
谢谢。但我试过了。
我的主要问题是当我从数据库中检索基因序列时,有些结果是基因序列,有些结果是蛋白质序列。我想如果我们想比较它们,我需要确保它们都是基因序列或者它们都是蛋白质序列,对吗?

这是我使用的代码:

 handle = Entrez.efetch(db="nucleotide", id=t ,rettype="gb")
 record = handle.read()

然后,对于某些 id,我得到了 agtc 的序列,而其他我得到了类似 mwvllvffll tltylfwpkt 的序列。它们是蛋白质对吗?

我被困在这里,我不知道下一步该怎么做。

【问题讨论】:

    标签: python similarity biopython


    【解决方案1】:

    您应该从阅读Biopython Tutorial 开始,它涵盖了所有基础知识。您的问题非常简单(假设您已经知道如何在 Python 中编程):读取基因名称或登录 ID,检索序列,对齐序列,然后生成摘要信息(同一性百分比、同源性百分比、缺口分数等)。 )。所有这些功能都在教程和cookbook 中介绍。 Biopython API documentation 在处理单个类和方法时也非常有用。

    祝你好运!

    【讨论】:

    • 谢谢。 @MattDMo,我稍微改了一下问题,你能看看吗?
    • 你是对的,有些是蛋白质,有些是核酸。在没有看到您的整个代码的情况下,我不确定您为什么会得到混合序列,但这可能与您使用的登录 ID 有关。我的建议是在 Entrez 网站上进行一些浏览,并尝试手动搜索您的输入,看看您会得到什么样的结果。例如,以NP_ 开头的ID 将是蛋白质序列,而NM_ 是DNA。您还可以在代码中进行一些完整性检查,这样如果返回的序列包含氨基酸,而您只想比较 DNA,它就会出错。
    【解决方案2】:

    如果你真的喜欢这个,你应该学习e-values'scores等的含义。像高分和低e-values对应更好的相似性。

    您必须比较相同的类型,但如果您想将核苷酸与蛋白质进行比较,请先将 dna 翻译为蛋白质。

    看看 NCBI、ENSEMBL、EBI 网站。它们为您提供几乎所有您需要的工具。

    如果您有很多要比较的序列,使用 biopython 是明智之举,但首先要像 MattDMo 所说的那样理解说明书。在互联网上四处看看,看看其他程序员是如何尝试理解他们的代码的。

    祝你好运

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2015-11-10
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多