【发布时间】:2018-08-08 07:00:24
【问题描述】:
在 PySpark 中,我试图比较 2 个共同列的数据帧。 Tha 数据帧如下所示:
df1 ... ...
aa1 ... ...
bb2 ... ...
ab3 ... ...
cc4 ... ...
df2 ... ...
a1 ... ...
b3 ... ...
这个想法是检查 df1 是否包含带有 df2 子字符串的行。如果是这样,请获取这些行。上面的结果将是:
result
aa1
ab3
或者在伪代码中:
df1.filter(df1.col.likes(df2.col))
提前致谢!
【问题讨论】:
-
尝试在条件下使用
join -
规则是什么?为什么你的结果中有 ab3 ?
-
抱歉,打错了。基本上,您检查第一个数据帧是否包含来自第二个数据帧的值。
标签: python-3.x apache-spark pyspark