【发布时间】:2016-06-15 12:08:36
【问题描述】:
我的文件大小不一,有些很大。我有很多这些文件,都是用 lzop 压缩的。
文件如下所示:
nodedef>name VARCHAR,family VARCHAR,composite VARCHAR,color VARCHAR
1104283,C,1,'238,32,77' 0,1,4,'255,182,83' 1,1,4,'255,182,83'
7,1,4,'255,182,83' 11,1,4,'255,182,83' 12,1,4,'255,182,83'
13,1,4,'255,182,83' 14,1,4,'255,182,83'
我想抓取第二个 Col 中所有带有 C 的行 - 带有“,C”的 grep 将执行此操作。我怎样才能加快速度?
我要查找的行将始终位于文件的顶部 - 但是行数可能会有所不同(不应超过 20 行)。该文件是有序的,因此只要带有“,C”的行与正则表达式不匹配,文件中就没有更多的“,C”。
我是否应该在这里查看并行化 grep(我可以访问具有多个内核的 HPC)?
谢谢, 回复
编辑: 同一个文件中可以有多个匹配项(并且包含“C”的行将始终聚集在文件顶部)
【问题讨论】:
-
如果您确定这 20 行,您是否尝试过使用 head ?
-
文件中第二列包含“C”的文件不能超过一行?
标签: python unix parallel-processing grep