【发布时间】:2015-03-24 04:24:44
【问题描述】:
我正在尝试找出在 5 列 csv 数据中查找重复项的最佳方法。真实数据中有超过百万行。
以下是上述6列的内容。
Name, address, city, post-code, phone number, machine number
数据没有固定长度,在某些情况下,某些列中的数据可能会丢失。
我正在考虑使用 perl 首先规范化名称、城市和地址中使用的所有短格式。来自 stackoverflow 的 perl 爱好者对我帮助很大。
但是仍然会有很多难以匹配的数据。
所以我想知道是否可以根据“LIKELINESS / SIMILARITY”(例如,类似于 gugl 的 google)来匹配内容,以克服收集数据时出现的错误。
我手头有 2 个任务。数据。
- 使用特定标识符标记重复行
- 提及相似行之间的百分比匹配。
如果我能就所有可能的方法可以采用哪些方法以及由于它们的某些优点而可能是最好的方法获得建议,我将不胜感激。
【问题讨论】:
-
重复是什么意思?因为你提到了类似的行。
-
我想说的是,数据是关于某个实体的。在收集信息时,有人可能使用了之前使用的确切数据,这将使其重复。在另一种情况下,信息收集器可能使用了简短的表格,或者可能在这里和那里遗漏了信息,这会使数据相似而不是重复。
-
对计算机程序的定义非常模糊。
标签: perl duplicates match