【发布时间】:2016-11-24 06:53:51
【问题描述】:
我正在尝试在 PySpark(类似于 this)中为两个数据帧(df1 和 df2)创建自定义连接,代码如下所示:
my_join_udf = udf(lambda x, y: isJoin(x, y), BooleanType())
my_join_df = df1.join(df2, my_join_udf(df1.col_a, df2.col_b))
我得到的错误信息是:
java.lang.RuntimeException: Invalid PythonUDF PythonUDF#<lambda>(col_a#17,col_b#0), requires attributes from more than one child
有没有办法编写可以处理来自两个单独数据帧的列的 PySpark UDF?
【问题讨论】:
标签: python apache-spark pyspark apache-spark-sql user-defined-functions