【发布时间】:2012-04-18 09:20:27
【问题描述】:
我有以下我需要的场景。
我有两个非常大的文件,其中的行数以千万计,而没有。每个文件中的行数相同。 我认为 awk 是一个有用的工具,我可以使用它加入两个文件,其中包含一些条件。请提出建议。
File1
# header1, header2, header3, header4
1,2,3,4
11,12,13,14
21,22,23,24
31,32,33,34
41,42,43,44
File2
a d e f
a f g h
b p q
33 b p q
43 b x y
Final Output
1, 2, 3, 4, a, d, e, f
11, 12, 13, 14, a, f, g, h
21, 22, 23, 24, b, p, q
31, 32, 33, 34, b, p, q
41, 42, 43, 44, b, x, y
file1、file2之间其实是有联系的。从file1的每一行收集很少的header,并基于一些小工具file2生成。所以对于file1中的每一行,file2的同一行中都有一些信息。 现在我想加入这两个文件,如下逻辑。
file2 的第一个条目包含 file1 的“a”、“b”或标题 3 基于此,如果它包含 'a' 或 'b' 则我们按“1、2、3、4、a、d、e、f”加入这些行
如果file2的入口有file1的header3,那么我们按“31,32,33,b,p,q”加入
所有字段都必须用逗号分隔。并且输出必须转储到其他文件中。
我也可以在 python 中做同样的事情,但是循环处理需要太多时间,因为文件太大,并且涉及到很多 python 解释时间。所以我认为 awk 会更好的实用程序做这样的任务。
请提出建议。谢谢。
【问题讨论】:
-
你的描述对我来说似乎有点(很多)令人困惑。首先你说两个文件都是逗号分隔的,但你的 file2 不是。而且,以千万为单位,你的意思是大量?(不得不向上看)。更重要的是,我是否正确地说,标题 1、标题 2 等是指数字 1、2、3、4 或 11、12、13、14 等?
-
Yes 正确... File1 包含一行,其中包含每个条目的其余行的标题。
-
所以,file1的line2对应file2的line1,file1的line3对应file2的line2,以此类推。我们必须按照上述条件加入。如果有任何其他疑问,请告诉我。
-
是的,这两个文件都非常大,所以为了通过 pythonic 循环处理每个文件,然后创建一个逻辑来加入文件似乎非常耗时.. 所以我去 awk 寻找更好的选择,并认为它会花费更少的时间..!!
-
你能贴出你正在使用的python代码吗?