【发布时间】:2021-03-01 00:34:41
【问题描述】:
我有两个如下图所示的数据框
import pandas as pd
import numpy as np
source_df = pd.DataFrame({'source_value':['21ABCDE1','22CDEF2','23DEF3','24FGH4']})
client_df = pd.DataFrame({'source_value':['21ABCDE1','29SB','21ABCDE1','29SB','25FG','25FG','31DE','35DE']})
我想做的是找到source_values 的数量,这些数量存在于client_df 中,但不存在于source_df 中。
请注意client_df 中可以有重复项,但source_df 中不能有重复项
基本上我必须识别它们,因为它们无效(因为它们在 source_df 的父数据框中丢失)
我尝试了以下,但它是为了匹配条目。
pd.merge(
source_df,client_df,
how="inner",
on = 'source_value').groupby('source_value').size()
我如何优雅地处理non-matching 条目,因为我有数百万条数据(至少有 1000 万条记录,最多可达到 1500 万条)。
我希望我的输出如下所示
【问题讨论】:
标签: python pandas dataframe pandas-groupby series