【发布时间】:2018-10-22 21:45:48
【问题描述】:
我知道以前有人问过这个问题。我已经搜索了这些线程,但对我来说没有任何意义。诚然,我是生物信息学的新手,所以对于有更多经验的人来说,答案可能很清楚。
我正在尝试使用 BWA 将读数与参考基因组对齐并保留丢弃的读数,因为我正在寻找可能感染宿主的潜在病原体 DNA(实际上是 RNA)。
我认为,我已经创建了参考基因组的索引。我有以下文件:
_genome.fa
_genome.fa.amb
_genome.fa.ann
_genome.fa.bwt
_genome.fa.pac
_genome.fa.sa
我想将双端读取与该索引对齐并保留丢弃。该代码是:
module load swset/2018.05
module load gcc/7.3.0
module load bwa
bwa mem ~/correctpath/_genome.fa correctfilename_R1_001.fastq correctfilename_R2_001.fastq -a > sample_bwa.sam
我继续收到错误:
[E::bwa_idx_load_from_disk] fail to locate the index files
我 99.% 确定我的文件路径正确。我可能加载了错误的 BWA 版本。我可能错误地创建了索引。或者我的 bwa mem 代码中可能存在明显错误。
我再次尝试阅读其他类似的帖子,但对我来说没有任何意义。这可能是我的错。
有人可以帮忙吗?
谢谢!
【问题讨论】:
-
您确定 fasta 文件和索引文件在
~/correctpath/中并且具有您使用的名称吗?它们都可以在读取模式下访问吗?您使用哪个命令来索引基因组?最后,您确定您确实使用了相同版本的 bwa? -
您的命令似乎没问题。如果你只有 99% 确定你得到了正确的路径,请检查它,因为这是你遇到麻烦的地方。尝试
ls ~/correctpath/_genome.fa*并检查您告诉我们的所有文件是否都已列出。 -
感谢您的提示!我将四重检查路径(这不是我第一次遇到一些愚蠢的错字,直到我第 1000 次查看它时才注意到)。我还将检查 bwa 版本。我们的机构刚刚切换到一个新的计算集群,所以我可能确实使用了不同的版本。对于索引,我只使用了
bwa index _genome.fa很高兴知道代码看起来正确,这使我的故障排除策略更简单一些。再次感谢!
标签: indexing bioinformatics genome