【发布时间】:2016-07-01 23:47:21
【问题描述】:
就 Spark DataFrame/SQL 上下文而言,UDF 和自定义表达式有什么区别?特别是,它们都对 Catalyst 不透明吗?使用一个与另一个的原因是什么?
(提到了自定义表达式,例如 here - 尽管在这种情况下不需要它们。)
【问题讨论】:
-
我找到了答案,但不是我的。 forums.databricks.com/answers/2706/view.html。看起来表达式有点像可以参与 Catalyst 和 Tungsten 优化的 UDF 版本。 (普通的UDF,即使是Scala的UDF也做不到。)貌似需要用Scala写,但是写好后,可以加上python API。
标签: scala apache-spark