【发布时间】:2016-09-14 12:13:46
【问题描述】:
【问题讨论】:
-
FuzzyWuzzy 是编辑距离的一种实现,它非常适合在 numpy 或类似语言中构建成对距离矩阵。要检测“重复”或近似匹配,您至少必须从每一行与其他行进行比较,否则您将永远不知道两者是否彼此接近。有关在 scipy 中使用 pdist 的解决方案,请参阅 stackoverflow.com/questions/24089973/…。
-
你可能会近似它——见cs.stackexchange.com/questions/2093/…
-
或看中:en.wikipedia.org/wiki/BK-tree。不确定这些是否对您的案例特别有帮助。
-
谢谢 - 我需要调查一下。您会建议按行执行距离操作,还是建议“添加”每个字段的距离?
-
这似乎很有趣gist.github.com/nibogd/94363e93f4e0256b4665eb743dbfa211 - 他们提到索引时间很慢但肯定不如 n^2 慢?
标签: python pandas fuzzy-search locality-sensitive-hash record-linkage