【问题标题】:Given 2 multivariate datasets, identify records representing the same entity, which differ slightly给定 2 个多元数据集,识别代表相同实体的记录,它们略有不同
【发布时间】:2016-10-12 18:22:50
【问题描述】:

我们以有 2 个数据源为例,数据大小分别为“m”和“n”。两个数据集都是具有相同架构但数据不同的 SQL 表。我们的目标是“标记”足够相似的模糊匹配(数据集之间)以考虑“相同”。

CREATE TABLE player(
    id Integer,
    fname VARCHAR(64),
    lname VARCHAR(64),
    birth_dt datetime,
    weight Integer
)

虽然大多数总组合 (m*n) 不会匹配,但我们希望标记“相似”匹配,如下所示:

{"fname": "John", "lname": "Smith", "birth_dt": "6/6/91", "weight": 220}
{"fname": "Jack", "lname": "Smith", "birth_dt": "6/6/91", "weight": 210}

是否有任何工具(开源或非开源)可以很好地识别和标记这些“匹配项”?

【问题讨论】:

    标签: machine-learning duplicates fuzzy-comparison


    【解决方案1】:

    这是“record linkage”的问题,该关键字将帮助您找到有关该问题的大量文献。

    开源 Python 库 dedupe 提供了一种综合方法。

    【讨论】:

    • 我们实际上使用了 Dedupe,结果证明这是一个很好的解决方案!保持开放状态以鼓励其他答案...
    • 以后,如果问题不是关于它,请在建议它时披露您与重复数据删除的从属关系。
    猜你喜欢
    • 2018-06-28
    • 1970-01-01
    • 2022-06-16
    • 2014-07-27
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2011-09-29
    相关资源
    最近更新 更多