【发布时间】:2011-03-26 19:50:15
【问题描述】:
我正在尝试在大型数据库中搜索长而近似的子字符串。例如,查询可能是一个 1000 个字符的子字符串,它可能与匹配项相差数百个编辑的 Levenshtein 距离。我听说索引 q-gram 可以做到这一点,但我不知道实现细节。我也听说 Lucene 可以做到,但是 Lucene 的 levenshtein 算法是否足够快,可以进行数百次编辑?也许是抄袭检测领域之外的东西?任何建议表示赞赏。
【问题讨论】:
-
出于兴趣,您正在搜索的字符串信息是什么 - 文本信息或以不同形式结构化的内容?
标签: indexing lucene substring information-retrieval