【发布时间】:2019-06-07 00:28:31
【问题描述】:
是否可以根据先前列的最大值添加新列,其中先前的列是字符串文字。考虑以下数据框:
df = spark.createDataFrame(
[
('1',25000,"black","black","white"),
('2',16000,"red","black","white"),
],
['ID','cash','colour_body','colour_head','colour_foot']
)
那么目标框架应该是这样的:
df = spark.createDataFrame(
[
('1',25000,"black","black","white", "black" ),
('2',16000,"red","black","white", "white" ),
],
['ID','cash','colour_body','colour_head','colour_foot', 'max_v']
)
如果没有可检测的最大值,则应使用最后一个有效颜色。
是否有某种可用的反击可能性或 udf?
【问题讨论】:
标签: python apache-spark pyspark apache-spark-sql