【发布时间】:2018-10-06 01:46:38
【问题描述】:
我正在使用 prokka 注释文件,这些文件为我提供了 uniprot 数据库中发现的基因的蛋白质产物。不幸的是,许多基因与多个非常相似的产品名称相关联,例如
1%2C2-phenylacetyl-CoA epoxidase%2C subunit A
1%2C2 phenylacetyl-CoA epoxidase%2C subunit A
1%2C2-phenylacetyl CoA epoxidase%2C subunit A
1%2C2-Phenylacetyl CoA Epoxidase%2C subunit A
而这些变体实际上是不同的产品
1%2C2-phenylacetyl-CoA epoxidase%2C subunit A
1%2C2-phenylacetyl-CoA epoxidase%2C subunit B
1%2C2-phenylacetyl-CoA epoxidase%2C subunit C
1%2C2-phenylacetyl-CoA epoxidase%2C subunit E
为了避免在将我的基因映射到它们各自的产品时遇到麻烦,我决定用“@”替换所有可能的歧义和有问题的字符,例如“-”、“/”,并将所有字符串都小写。
但是有没有办法搜索例如对于
1%2C2-Phenylacetyl CoA Epoxidase%2C subunit A
是否包括与标准 unix 工具(如 grep)密切相关的条目?到目前为止我找不到答案。
【问题讨论】:
-
你的意思是说
1%2C2-Phenylacetyl CoA Epoxidase%2C subunit A和1%2C2-phenylacetyl CoA epoxidase%2C subunit A不一样? -
您的要求是完全匹配文件中的字符串
1%2C2-Phenylacetyl CoA Epoxidase%2C subunit A吗? -
第一组4个名称代表同一个产品,但存入数据库略有不同。后4个名字实际上是不同的。我想使用例如前 4 个字符串之一也可以找到其他 3 个版本。希望这会有所帮助
标签: string bash unix fuzzy-search approximate