【发布时间】:2023-02-09 19:23:19
【问题描述】:
我是生物信息学的新手,非常希望能得到一些帮助!
我有一个大的 multi-fasta 文件(genes.faa),像这样:
>gene1_A
MCTGTRNKIIRTCDNCRKRKIKCDRKRPAC
>gene2_A
MCTGTRNKIIRTCDNCRKRKIKCDRKRPAC
>gene3_B
MCTGTRNKIIRTCDNCRKRKIKCDRKRPAC
>gene4_B
MCTGTRNKIIRTCDNCRKRKIKCDRKRPAC
(...)
以及基因对列表 (gene.pairs.txt),每行两个基因由制表符分隔:
gene13_A \t gene33_B
gene2_A \t gene48_B
gene56_A \t gene2_B
我需要一种方法来读取基因对列表并为基因对列表的每一行创建一个 fasta 文件。所以,在这种情况下,我会有 3 个 fasta 文件(输出 fasta 文件的名称并不重要),如下所示:
法斯塔1
>gene13_A
MCTGTRNKIIRTCDNCRKRKIKCDRKRPAC
>gene33_B
MCTGTRNKIIRTCDNCRKRKIKCDRKRPAC
法斯塔2
>gene2_A
MCTGTRNKIIRTCDNCRKRKIKCDRKRPAC
>gene48_B
MCTGTRNKIIRTCDNCRKRKIKCDRKRPAC
法斯塔3
>gene56_A
MCTGTRNKIIRTCDNCRKRKIKCDRKRPAC
>gene2_B
MCTGTRNKIIRTCDNCRKRKIKCDRKRPAC
我试图用 python 编写脚本,但我找不到一种方法来循环读取列表并为每一行编写一个 fasta 文件。 非常感谢您的帮助!
【问题讨论】:
-
请编辑问题以向我们展示您最近尝试的代码以及您遇到困难的地方。另请参阅:How to Ask 和 help center。此外,您可能想使用Biopython,特别是
Bio.SeqIO。 Biopython 可以很容易地安装,例如使用conda。
标签: list bioinformatics biopython fasta