【发布时间】:2013-03-18 05:25:03
【问题描述】:
在 unix 终端上,我们可以使用diff file1 file2 来查找两个文件之间的差异。是否有类似的命令来显示 2 个文件的相似性? (如有必要,允许使用许多管道。
每个文件都包含一行带有字符串的句子;它们被排序并使用sort file1 | uniq 删除重复的行。
file1:http://pastebin.com/taRcegVn
file2:http://pastebin.com/2fXeMrHQ
并且输出应该输出两个文件中出现的行。
output:http://pastebin.com/FnjXFshs
我可以使用 python 来做到这一点,但我认为将其放入终端有点过多:
x = set([i.strip() for i in open('wn-rb.dic')])
y = set([i.strip() for i in open('wn-s.dic')])
z = x.intersection(y)
outfile = open('reverse-diff.out')
for i in z:
print>>outfile, i
【问题讨论】:
-
你的文件是什么样的?
-
大多数时候是一串人类语言的句子。有时也会列有更多信息。
-
也许您可以举两个简单文件的示例以及您希望从该输入中获得的那种输出?我不清楚你到底想要达到什么目的。了解更多这样做的动机也会有所帮助,因为有人可能有不同的方法来解决您的问题。
-
您希望输出是两个文件共有的行的列表?
标签: file unix diff similarity