【发布时间】:2015-09-19 06:58:43
【问题描述】:
我想做一个我认为非常简单的操作——将一个包含每个人的数字的列添加到一个包含(可能)重复名称列表的数据集中。我认为我很接近。此代码查看名称数据集,进行成对比较,并附加一列是否可能匹配。现在我只想更进一步——我不想删除重复项,而是想出一个唯一标识符。
彼得
例子:
彼得
彼得
彼得
康纳
马特
会变成
例子:
彼得 -- 1
彼得 -- 1
彼得 -- 1
康纳——2
马特 -- 3
library(RecordLinkage)
data(RLdata10000)
rpairs <- compare.dedup(RLdata10000, blockfld = 5)
p=epiWeights(rpairs)
classify <- epiClassify(p,0.7)
summary(classify)
match <- classify$prediction
results <- cbind(classify$pairs,match)
【问题讨论】:
标签: r