【发布时间】:2020-01-23 14:23:36
【问题描述】:
我在使用此函数时遇到了一些性能问题,如果字符串数组的字符串与 val 参数匹配,则该函数旨在返回 True。我想把它翻译成 Pandas UDF。
def list_contains(val):
# Perfom what ListContains generated
def list_contains_udf(column_list):
for element in column_list:
if element.startswith(val):
return True
return False
return udf(list_contains_udf, BooleanType())
我怎样才能做到这一点?
【问题讨论】:
-
如果您使用的是 spark 2.4+,请检查 spark sql 内置函数是否存在:spark.apache.org/docs/latest/api/sql/index.html#exists
标签: python pandas pyspark databricks