【发布时间】:2015-03-17 14:45:06
【问题描述】:
我在 R 中有两个字符类型的向量。
我希望能够使用 jarowinkler 将参考列表与原始字符列表进行比较并分配 % 相似度分数。因此,例如,如果我有 10 个参考项目和 20 个原始数据项目,我希望能够获得比较的最佳分数以及算法与之匹配的内容(所以 2 个向量,共 10 个)。如果我有大小为 8 和 10 个参考项目的原始数据,我应该只得到 8 个项目的 2 个向量结果,每个项目具有最佳匹配和得分
item、match、matched_to 冰,78,冰淇淋
下面是我的代码,没什么可看的。
NumItems.Raw = length(words)
NumItems.Ref = length(Ref.Desc)
for (item in words)
{
for (refitem in Ref.Desc)
{
jarowinkler(refitem,item)
# Find Best match Score
# Find Best Item in reference table
# Add both items to vectors
# decrement NumItems.Raw
# Loop
}
}
【问题讨论】:
-
也许是 RecordLinkage 包,以及由此构建的函数? compareJW cutoff }
-
如果有多个最佳拟合具有相同的 jarowinkler 分数,您的匹配标准是什么?您选择第一个匹配项,还是随机选择最佳匹配项?
标签: r string levenshtein-distance