【发布时间】:2022-01-28 19:40:04
【问题描述】:
我的问题与this 基本相同,但我不想使用awk,而是想使用Python,假设它并不比使用其他方法慢很多。我正在考虑逐行阅读并即时压缩,但后来我遇到了this 帖子,这听起来是个坏主意(压缩效率不是很高)。我遇到了this nice-looking gzip built-in Python library,所以我希望有一些干净、快速、高效的 pythonic 方式来做到这一点。
我想从这里开始:
gzcat file1.gz
# header
1
2
到这里:
# header
1
2
1
2
1
2
1
2
我有几百个文件,未压缩的总大小约为 60 GB。这些文件是压缩后的 CSV 文件。
【问题讨论】:
-
在 Python 中可能会太慢。我建议尝试
subprocess模块从您的 Python 代码中调用gzcat。一个简单的例子(使用 zcat):codebright.wordpress.com/2011/03/25/139 分析和相关讨论:dalkescientific.com/writings/diary/archive/2020/09/16/…
标签: python-3.x gzip