【发布时间】:2011-01-25 04:38:39
【问题描述】:
我试图从字段中删除重复项(并将它们替换为空白),前提是之前的字段相同。例如:
示例输入:
France Paris Museum of Fine Arts blabala
France Paris Museum of Fine Arts blajlk
France Paris Yet another museum lqmsjdf
France Paris Museum of National History mlqskjf
France Bordeaux Museum of Fine Arts qsfsqf
France Bordeaux City Hall lmqjflqsk
France Bordeaux City Hall lqkjfqlskjflqskfj
Spain Madrid Museum of Fine Arts lqksjfh
Spain Madrid Museum of Fine Arts qlmfjlqsjf
Spain Barcelona City Hall nvqjvvnqk
Spain Barcelona Museum of Fine Arts lmkqjflqksfj
期望的输出:
France Paris Museum of FineArts blabala
blajlk
Yet another museum lqmsjdf
Museum of National History mlqskjf
Bordeaux Museum of Fine Arts qsfsqf
City Hall lmqjflqsk
lqkjfqlskjflqskfj
Spain Madrid Museum of Fine Arts lqksjfh
qlmfjlqsjf
Barcelona City Hall nvqjvvnqk
Museum of Fine Arts lmkqjflqksfj
非常感谢您的任何帮助。
【问题讨论】:
-
您可能可以在
awk中使用函数来执行此操作,但为什么呢?它似乎更适合更通用的语言。也许 Python 使用csv模块?此外,除非这是最后一步,否则这可能不是一个好主意,因为这会使将来解析文件变得更加困难。 -
我有一个在这里完成几乎相同的脚本:stackoverflow.com/questions/4785566/…,但我必须保留经常回来的机构的名称。所以需要时间来隔离它们(1500行)。至于输出,它符合我的目的,因为该文件在某处被处理为 LaTeX。
-
这是指向当前页面的链接。也许你的意思是this question。
-
记录是否有序?具体来说,“法国巴黎还……”会不会出现在两个“法国巴黎博物馆……”之间?此外,字段是否以制表符分隔(除了字段内没有空格,字段内没有制表符)?
-
@Dennis:是的,我的意思是那个脚本!到目前为止,我就是这样完成工作的,直到我意识到我可以做得更好(嗯……“某人”可以做得更好)。那时我还没有完全分析问题(实际上是被淹没了)。是的,数据已排序。
标签: awk duplicates