【发布时间】:2019-09-27 21:14:31
【问题描述】:
我是 PySpark 的新手。
我已经阅读了镶木地板文件。我只想保留至少有 10 个值的列
我使用 describe 来获取每列的非空记录数
我现在如何提取值少于 10 个的列名,然后在写入新文件之前删除这些列
df = spark.read.parquet(file)
col_count = df.describe().filter($"summary" == "count")
【问题讨论】:
-
诚然,它不是完全重复的,但解决方案基本上是一样的