【发布时间】:2017-11-22 10:00:13
【问题描述】:
我有一个扩展 GenericUDF 的 HiveUDF,当我通过 spark.sql 调用 udf 时,我得到了正确的结果,但初始化的方法被多次调用。
不明白为什么会这样?
【问题讨论】:
标签: apache-spark apache-spark-sql hiveql hive-udf
我有一个扩展 GenericUDF 的 HiveUDF,当我通过 spark.sql 调用 udf 时,我得到了正确的结果,但初始化的方法被多次调用。
不明白为什么会这样?
【问题讨论】:
标签: apache-spark apache-spark-sql hiveql hive-udf
这里似乎是一个火花错误https://issues.apache.org/jira/browse/SPARK-17728。
您可以在应用 UDF 之前尝试cache() 数据,但有时这种解决方法会降低性能。
【讨论】: