【问题标题】:Use pandas_udf with spark 2.2将 pandas_udf 与 spark 2.2 一起使用
【发布时间】:2019-05-04 10:28:36
【问题描述】:

无论如何在 pyspark 2.2 中使用pandas_udf

【问题讨论】:

    标签: pandas pyspark user-defined-functions


    【解决方案1】:

    实际上,您正在创建一个函数,然后从该给定函数创建一个 pandas_udf。 如果您想将其用作 pyspark udf,您所要做的就是从该函数创建一个 pyspark udf。 使用databricks文档中的给定示例:

    from pyspark.sql.functions import *
    from pyspark.sql.types import *
    
    def multiply_func(a, b):
        return a * b
    
    #the return type depends on your values, so it can be DoubleType()
    multiply_func_udf = udf(lambda x,y: multiply_func(x,y), IntegerType())
    
    #then you can call like
    spark_df.withColumn("multiplied_values",multiply_func_udf(col("x"),col("y"))
    

    【讨论】:

    • 我正在寻找一种在 spark 2.2 中使用 apache 箭头的方法,在 spark 2.3 中默认支持该箭头
    猜你喜欢
    • 2018-01-27
    • 1970-01-01
    • 1970-01-01
    • 2011-01-20
    • 1970-01-01
    • 1970-01-01
    • 2015-07-15
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多