【发布时间】:2019-06-17 10:51:56
【问题描述】:
我在 PySpark 设置中有一个数据框 df。我想更改一列,比如说它叫做 A,它的数据类型是“string”。我想根据它们的长度改变它的值。特别是,如果一行中只有一个字符,我们希望将 0 连接到末尾。否则,我们采用默认值。 “已修改”列的名称仍必须为 A。这是针对使用 PySpark3 的 Jupyter Notebook。
这是我迄今为止尝试过的:
df = df.withColumn("A", when(size(df.col("A")) == 1, concat(df.col("A"), lit("0"))).otherwise(df.col("A")))
我也尝试使用相同的代码删除“df.col”。
当我运行此代码时,软件抱怨说语法无效,但我没有看到错误。
【问题讨论】:
标签: python dataframe pyspark jupyter-notebook