【发布时间】:2018-10-17 22:56:52
【问题描述】:
所以我想逐行计算数据帧中空值的数量。
请注意,有 50 多列,我知道我可以使用 case/when 语句来执行此操作,但我更喜欢更简洁的解决方案。
例如,一个子集:
columns = ['id', 'item1', 'item2', 'item3']
vals = [(1, 2, 0, None),(2, None, 1, None),(3,None,9, 1)]
df=spark.createDataFrame(vals,columns)
df.show()
+---+-----+-----+-----+
| id|item1|item2|item3|
+---+-----+-----+-----+
| 1| 2| 'A'| null|
| 2| null| 1| null|
| 3| null| 9| 'C'|
+---+-----+-----+-----+
运行代码后,想要的输出是:
+---+-----+-----+-----+--------+
| id|item1|item2|item3|numNulls|
+---+-----+-----+-----+--------+
| 1| 2| 'A'| null| 1|
| 2| null| 1| null| 2|
| 3| null| 9| 'C'| 1|
+---+-----+-----+-----+--------+
编辑:并非所有非空值都是整数。
【问题讨论】:
标签: dataframe pyspark apache-spark-sql pyspark-sql