【发布时间】:2016-04-14 09:30:00
【问题描述】:
我的 bash-foo 现在有点生锈了,所以我想看看是否有一种聪明的方法可以从文件中删除部分重复项。我有一堆包含数千行的文件,格式如下:
String1|String2|String3|String4|String5|String6|...|String22|09-Apr-2016 05:28:03|x
本质上它是一堆用管道分隔的字符串,最后两列是时间戳和 x。我想做的是连接我的所有文件,然后删除所有部分重复。我将部分重复定义为文件中从 String1 到 String22 匹配的一行,但时间戳可以不同。
例如,一个文件包含:
String1|String2|String3|String4|String5|String6|...|String22|09-Apr-2016 05:28:03|x
String1|String2|String3|String4|String5|String6|...|String22|09-Apr-2016 12:12:12|x
String124|String2|String3|String4|String5|String6|...|String22|09-Apr-2016 05:28:03|x
会变成:
String1|String2|String3|String4|String5|String6|...|String22|09-Apr-2016 05:28:03|x
String124|String2|String3|String4|String5|String6|...|String22|09-Apr-2016 05:28:03|x
(选择哪个时间戳无关紧要)。
有什么想法吗?
【问题讨论】: