【发布时间】:2016-10-12 18:22:50
【问题描述】:
我们以有 2 个数据源为例,数据大小分别为“m”和“n”。两个数据集都是具有相同架构但数据不同的 SQL 表。我们的目标是“标记”足够相似的模糊匹配(数据集之间)以考虑“相同”。
CREATE TABLE player(
id Integer,
fname VARCHAR(64),
lname VARCHAR(64),
birth_dt datetime,
weight Integer
)
虽然大多数总组合 (m*n) 不会匹配,但我们希望标记“相似”匹配,如下所示:
{"fname": "John", "lname": "Smith", "birth_dt": "6/6/91", "weight": 220}
{"fname": "Jack", "lname": "Smith", "birth_dt": "6/6/91", "weight": 210}
是否有任何工具(开源或非开源)可以很好地识别和标记这些“匹配项”?
【问题讨论】:
标签: machine-learning duplicates fuzzy-comparison