【发布时间】:2021-04-22 13:10:58
【问题描述】:
我有两个数据框:
df1
Code Number
0 ABC123 1
1 DEF456 2
2 GHI789 3
3 DEA456 4
df2
Code
0 ABD123
1 DEA458
2 GHI789
df1 就像一本字典,我可以通过检查它们的代码从中获取每个项目的相应编号。但是,有未注册的代码,如果我找到未注册的代码,我应该寻找看起来最像它们的代码。所以,结果应该是:
ABD123 = 1(因为它与 ABC123 有 1 个不同的字符)
DEA456 = 4(因为它有1个与DEA456不同的字符,2个来自DEF456,所以它选择最接近的一个)
GHI789 = 3(因为它在 df1 有一个等价物)
我知道如何分别检查每个代码的差异并保存不同字符的“长度”,但我不知道如何应用此代码,因为我不知道如何比较 df2 中的每一行针对 df1 中的所有行。有什么办法吗?
【问题讨论】:
-
this question 的可能重复项。
-
不幸的是,我无法为 Python 获得新的包或库,因此 sklearn 解决方案不适合我……曾经和我一起工作的一个人设法创建了一个完全可以执行的逻辑我需要什么,但我不能完全理解他做了什么,因此我不能在其他地方应用它