【问题标题】:Grepping progressively through large file通过大文件逐步搜索
【发布时间】:2013-07-03 21:01:01
【问题描述】:

我有几个大型数据文件(约 100MB-1GB 的文本)和一个包含数万个时间戳的排序列表,用于索引感兴趣的数据点。时间戳文件如下所示:

12345
15467
67256
182387
199364
...

数据文件看起来像:

Line of text
12345 0.234 0.123 2.321
More text
Some unimportant data
14509 0.987 0.543 3.600
More text
15467 0.678 0.345 4.431

第二个文件中的数据都是按时间戳的顺序排列的。我想使用第一个文件的时间戳来遍历第二个文件,在输出文件中打印时间戳和第四个数据项。我一直在用这个:

grep -wf time.stamps data.file | awk '{print $1 "\t" $4 }'  >> output.file

完成每个数据文件需要一天的时间。问题是这个命令在整个数据文件中搜索 time.stamps 中的每一行,但我只需要从最后一个数据点开始搜索。有什么方法可以加快这个过程?

【问题讨论】:

    标签: shell unix grep


    【解决方案1】:

    您可以在awk 中完全做到这一点……

    awk 'NR==FNR{a[$1]++;next}($1 in a){print $1,$4}' timestampfile datafile
    

    【讨论】:

    • +1:我花了一点时间来了解它是如何工作的,但是一旦我了解到脚本的第一部分正在将所有时间戳加载到数组 a 中,第二部分正在检查对于数据文件中第一个字段在该数组中的存在,我可以看到这是一个非常优雅的解决方案,只需要足够的内存来存储所有时间戳。
    • @Simon 我的朋友,你学得很快。它正是这样做的。为了进一步提高性能,您可以在匹配后删除数组元素。这将减少下一次扫描的大小,尽管如果该元素再次出现在文件中,它将不匹配。
    • 不错!之前需要 8 小时的作业现在需要 12 秒。
    【解决方案2】:

    JS웃 的awk 解决方案可能是要走的路。如果join 可用并且不相关的“数据”的第一个字段不是数字,您可以利用文件顺序相同的事实并避免排序步骤。此示例在 linux 上使用 bash 进程替换

    join  -o2.1,2.4 -1 1 -2 1 key.txt <(awk '$1 ~ /^[[:digit:]]+$/' data.txt)
    

    【讨论】:

      【解决方案3】:

      'grep' 有一个很少使用的选项-f filename,它从文件名中获取模式并进行匹配。它可能会击败 awk 解决方案,并且您的时间戳不必排序。

      【讨论】:

        猜你喜欢
        • 2016-03-02
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        相关资源
        最近更新 更多