【发布时间】:2015-09-28 18:28:57
【问题描述】:
我正在使用 Spark 1.3.0 和 Python。我有一个数据框,我希望添加一个从其他列派生的附加列。像这样,
>>old_df.columns
[col_1, col_2, ..., col_m]
>>new_df.columns
[col_1, col_2, ..., col_m, col_n]
在哪里
col_n = col_3 - col_4
如何在 PySpark 中执行此操作?
【问题讨论】:
标签: python apache-spark apache-spark-sql pyspark