【发布时间】:2014-07-14 05:31:00
【问题描述】:
我有一个List<String[]> 的 Java 客户记录(来自数据库)。我通过手动观察数据知道 25%+ 是重复的。
虽然重复的内容远非准确。有时它们有不同的邮编,但名称和地址相同。其他时候地址完全丢失,等等......
经过一天的研究;我仍然很困惑如何开始解决这个问题?
我应该在谷歌上搜索哪些“术语”来描述这个领域(从 Java 角度解决这个问题)?而且我不认为有fuzzymatch.jar 可以让这一切变得简单吗?
【问题讨论】:
-
编辑距离算法,例如 Levenshtein 距离或 Hamming 距离以及可能的推导。
-
Lucerne 和 solr 是用 java 和功能工具编写的,用于模糊匹配等。
-
Levenshtein 只能处理字符串?不是一组字符串?
标签: java pattern-matching fuzzy-search