【问题标题】:Fuzzy Match based on Key Words基于关键词的模糊匹配
【发布时间】:2020-09-17 19:57:04
【问题描述】:

我有两张桌子

df_1

df_2

我有什么方法可以开发一个模糊匹配逻辑(在 Python 中或在 R 中)从 df_2 中找到 ID for df_1

匹配应该基于模糊的name匹配,准确的citystatezip匹配。 如果在city_1 中找不到匹配项,我会在city_2 中查找匹配项。如果在state_1 中找不到匹配项,我会在state_2 中查找匹配项。 df_2 也是如此。如果在NAME_1 中找不到模糊名称匹配,我会在NAME_2 中找到模糊匹配。

预期的输出应如下所示:

【问题讨论】:

  • 签出fuzzywuzzy库。并且不要忘记安装 python-Levenshtein

标签: python r pandas


【解决方案1】:

结帐fuzzywuzzy 库。它使用拉文斯坦距离来比较匹配。如果您对结果不服,可以使用n gram analysis

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2018-03-22
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2014-03-05
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多