【问题标题】:bioinformatics compressing nucleotide sequences生物信息学压缩核苷酸序列
【发布时间】:2021-10-30 04:54:23
【问题描述】:

对于压缩由 fasta 核苷酸序列组成的数据集,推荐的压缩算法是什么(.xz、tar.gz、tar.bz2 等)?

对于此类数据,推荐的压缩机制是什么?

  1. 基于字典的压缩
  2. 基于自适应字典的压缩
  3. 基于 LZW 算法的压缩

【问题讨论】:

  • 使用 gzip 因为每个人都使用 gzip。即使您可以从另一种方法中获得更多压缩,更多的生物信息学工具也会读取 gzip 压缩文件。
  • 当然不是 LZW。那是过时的技术。人们对测序数据的压缩给予了极大的关注。对于fasta,请参阅ncbi.nlm.nih.gov/pmc/articles/PMC3866555

标签: compression bioinformatics fasta


【解决方案1】:

我见过gzip 最常用,所以我推荐gzip,正如评论中提到的CJR。这是与协作者最兼容的选项,即使不是最有效的(取决于您对效率的定义)。

在某些情况下,合作者和您可以安装专门的压缩工具,可能值得研究更有效的工具,例如参见这篇论文,其中使用几种不同的指标比较了其中的许多工具(尤其是图 1):

Kirill Kryukov、Mahoko Takahashi Ueda、So Nakagawa、Tadashi Imanishi,序列压缩基准 (SCB) 数据库 — FASTA 格式序列的无参考压缩器的综合评估,GigaScience,第 9 卷,第 7 期,7 月2020, giaa072, https://doi.org/10.1093/gigascience/giaa072 : https://academic.oup.com/gigascience/article/9/7/giaa072/5867695

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2014-03-07
    • 2011-10-28
    • 2018-04-12
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多