1.为什么要做这两步(why):

indel的重新比对:这是由于比对软件的自身限制,其可能将包括indel的read解释为snp的read,这就导致calling的错误和后面的碱基质量分数的重新校准。

碱基质量分数的重新校准:这是由于测序机器的系统性误差导致的,假设机器能识别5亿个碱基有99%的概率是对,那么也就说有5千万可能是错的,这些错误就可能被作为mutation calling出来,即假阳性。

 

2.怎么做的(how):

indel的重新比对:

1.先找到需要重新比对的区域:GATK之RealignerTargetCreator。基本思路是用千人基因组计划里面收集的indel数据来作为模板来找出bam文件里面的indel。

2.重新比对:看哪种比对结果的分数高,就选那一个:GATK之IndelRealigner

 

碱基质量分数的重新校准:GATK之BaseRecalibrator

BaseRecalibrator是如何识别哪些位点应该矫正的:其只矫正非现有的snp的点,即现有已经公布的snp点认为是正确的,不需要矫正。

 

 

 

 

 

 

参考资料:

1.https://mp.weixin.qq.com/s/LMZgy_8aJ6cm6VGK9Mud2A

2.http://www.biotrainee.com/thread-1402-1-1.html

相关文章:

  • 2022-12-23
  • 2021-07-15
  • 2021-08-06
  • 2021-07-27
  • 2022-12-23
  • 2022-12-23
  • 2021-10-01
  • 2022-12-23
猜你喜欢
  • 2022-12-23
  • 2022-01-16
  • 2021-05-12
  • 2021-11-04
  • 2021-07-12
  • 2021-04-03
  • 2021-05-10
相关资源
相似解决方案