【发布时间】:2016-08-14 01:12:22
【问题描述】:
我有一个已转换为 Spark SQL DataFrame 的 RDD。我想用 UDF 对列进行一些转换,最终看起来像这样:
df = df.withColumn("col1", udf1(df.col1))\
.withColumn("col2", udf2(df.col2))\
...
...
.withColumn("newcol", udf(df.oldcol1, df.oldcol2))\
.drop(df.oldcol1).drop(df.oldcol2)\
...
等等。
有没有更简洁的方式来表达这一点(重复的withColumn 和drop 调用)?
【问题讨论】:
标签: apache-spark pyspark apache-spark-sql pyspark-sql