【发布时间】:2023-04-03 02:58:01
【问题描述】:
我目前有两个数据框,一个用于donors,一个用于fundraisers。我正在尝试查找是否有 fundraisers 也捐赠了,如果是,请将其中的一些信息复制到我的 fundraiser 数据集(捐赠者姓名、电子邮件和他们的第一次捐赠)中。我的数据存在以下问题:
- 我需要按姓名和电子邮件进行匹配,但用户的姓名可能略有不同(例如“Kat”和“Kathy”)。
-
donors和fundraisers的名称重复:- 2a) 对于捐赠者,我可以获得唯一的姓名/电子邮件组合,因为我只关心第一个捐赠日期
- 2b) 对于筹款活动,尽管我需要保留两行并且不会丢失日期等数据。
我现在拥有的示例代码:
import pandas as pd
import datetime
from fuzzywuzzy import fuzz
import difflib
donors = pd.DataFrame({"name": pd.Series(["John Doe","John Doe","Tom Smith","Jane Doe","Jane Doe","Kat test"]), "Email": pd.Series(['a@a.ca','a@a.ca','b@b.ca','c@c.ca','something@a.ca','d@d.ca']),"Date": (["27/03/2013 10:00:00 AM","1/03/2013 10:39:00 AM","2/03/2013 10:39:00 AM","3/03/2013 10:39:00 AM","4/03/2013 10:39:00 AM","27/03/2013 10:39:00 AM"])})
fundraisers = pd.DataFrame({"name": pd.Series(["John Doe","John Doe","Kathy test","Tes Ester", "Jane Doe"]),"Email": pd.Series(['a@a.ca','a@a.ca','d@d.ca','asdf@asdf.ca','something@a.ca']),"Date": pd.Series(["2/03/2013 10:39:00 AM","27/03/2013 11:39:00 AM","3/03/2013 10:39:00 AM","4/03/2013 10:40:00 AM","27/03/2013 10:39:00 AM"])})
donors["Date"] = pd.to_datetime(donors["Date"], dayfirst=True)
fundraisers["Date"] = pd.to_datetime(donors["Date"], dayfirst=True)
donors["code"] = donors.apply(lambda row: str(row['name'])+' '+str(row['Email']), axis=1)
idx = donors.groupby('code')["Date"].transform(min) == donors['Date']
donors = donors[idx].reset_index().drop('index',1)
所以这给我留下了每个捐赠者的第一笔捐款(假设任何具有完全相同姓名和电子邮件的人都是同一个人)。
理想情况下,我希望我的 fundraisers 数据集看起来像:
Date Email name Donor Name Donor Email Donor Date
2013-03-27 10:00:00 a@a.ca John Doe John Doe a@a.ca 2013-03-27 10:00:00
2013-01-03 10:39:00 a@a.ca John Doe John Doe a@a.ca 2013-03-27 10:00:00
2013-02-03 10:39:00 d@d.ca Kathy test Kat test d@d.ca 2013-03-27 10:39:00
2013-03-03 10:39:00 asdf@asdf.ca Tes Ester
2013-04-03 10:39:00 something@a.ca Jane Doe Jane Doe something@a.ca 2013-04-03 10:39:00
我尝试关注此线程:is it possible to do fuzzy match merge with python pandas?,但不断出现索引超出范围错误(猜测它不喜欢筹款活动中的重复名称):(那么有什么想法可以匹配/合并这些数据集吗?
用 for 循环来做(它有效,但速度非常慢,我觉得必须有更好的方法)
代码:
fundraisers["donor name"] = ""
fundraisers["donor email"] = ""
fundraisers["donor date"] = ""
for donindex in range(len(donors.index)):
max = 75
for funindex in range(len(fundraisers.index)):
aname = donors["name"][donindex]
comp = fundraisers["name"][funindex]
ratio = fuzz.ratio(aname, comp)
if ratio > max:
if (donors["Email"][donindex] == fundraisers["Email"][funindex]):
ratio *= 2
max = ratio
fundraisers["donor name"][funindex] = aname
fundraisers["donor email"][funindex] = donors["Email"][donindex]
fundraisers["donor date"][funindex] = donors["Date"][donindex]
【问题讨论】:
-
你使用什么版本的 python/pandas?它适用于我在 Python 2.7.5 和 Pandas 0.12
-
我为我的项目创建了一个小型库,尤其是模糊连接。它可能不是最快的解决方案,但它可能对第 1 部分有所帮助,请随意使用。 Link to my GitHub repo
标签: python pandas dataframe fuzzywuzzy fuzzy-comparison