【发布时间】:2014-08-27 06:05:38
【问题描述】:
我是 Perl(正则表达式)的新手。我需要一个例子来说明如何编写一个程序来找出多个蛋白质序列中的回文(完美)(在一个文件中让它成为 4 个序列,数量为 200 个氨基酸)我必须过滤掉回文和回文序列在序列中的位置。
>TRE|Q47404|Q47404 (409 AA) Glycosyl transferase [Escherichia coli]
MIFDASLKKLRKLFVNPIGFFRDSWFFNSKNKAEELLSPLKIKSKNIFIVAHLGQLKKAE
LFIQKFSRRSNFLIVLATKKNTEMPRLILEQMNKKLFSSYKLLFIPTEPNTFSLKKVIWF
YNVYKYIVLNSKAKDAYFMSYAQHYAIFIWLFKKNNIRCSLIEEGTGTYKTEKKKPLVNI
NFYSWIINSIILFHYPDLKFENVYGTFPNLLKEKFDAKKIFEFKTIPLVKSSTRMDNLIH
>TRE|O06435|O06435 (492 AA) SynE [Neisseria meningitidis]
MLQKIRKALFHPKKFFQDSQWFATPLFSSFAPKSNLFIISTFAQLNQAHSLTKMQKLKNN
LLVILYTTQNMKMPKLIQKSVDKELFSVTYMFELPRKPGIVSPKKFLYIQRGYKKLLKTI
QPAHLYVMSFAGHYSSLLSLAKKMNITTHLVEEGTATYAPLLESFTYKPTKFEQRFVGNN
LHQKGYFDKFDILHVAFPEYAKKIFNANEYHRFFAHSGGISTSQSIAKIQDKYRISQNDY
IFVSQRYPVSDEVYYKTIVETLNQMSLRIEGKIFIKLHPKEMENKNIMSLFLNMVTINPR
>TRE|Q8VRL9|Q8VRL9 (492 AA) SiaD [Neisseria meningitidis]
MLQKIRKALFHPKKFFQDSQWFATPLFSSFAPKSNLFIISTFAQLNQAHSLTKMQKLKNN
LLVILYTTQNMKMPKLIQKSVDKELFSVTYMFELPRKPGIVSPKKFLYIQRGYKKLLKTI
QPAHLYVMSFAGHYSSLLSLAKKMNITTHLVEEGTATYAPLLESFTYKPTKFEQRFVGNN
LHQKGYFDKFDILHVAFPEYAKKIFNANEYHRFFAHSGGISTSQSIAKIQDKYRISQNDY
我需要完美回文的输出以及它们的位置。 我浏览了很多文章,但没有更好的主意。请为此建议我一些技术和程序。
【问题讨论】:
-
阅读perlretut - Recursive Patterns。它包含一个用于查找回文的正则表达式示例。
-
如果您提供一些输入和预期输出示例,您可能会得到更好的答案。
-
请检查,我已包含示例。 !!
-
我必须检查每个字符串。我的意思是让第一个字符串为 x,结尾为 y so ,x 到 y,x+1 到 y,x+2 到 y,x+3 到 y 等等。
标签: regex algorithm perl bioinformatics palindrome