【发布时间】:2018-04-26 15:15:59
【问题描述】:
我是 Spark 的新手,这可能是一个简单的问题。
我在 pyspark DF1 中有一个表,列名“A”和其他一些列。其他列名称可能会在各种情况下发生变化。我想通过将这些“其他”列的值除以 A 来生成表 DF2。DF2 的列也将是“其他”列。
例如对于
DF1 = sql_sc.createDataFrame([(1, 2,3), (2, 4,6), (3, 6,9), (4, 8,12), (5, 10,15)], ["A", "B","C"])
结果将是一个表格:
DF2 = sql_sc.createDataFrame([(2,3), (2,3), (2,3), (2,3), (2,3)], ["B","C"]
如何在 pyspark SQL 中完成这项任务?
谢谢
【问题讨论】: