【问题标题】:Remove null rows in pyspark dataframe [duplicate]删除pyspark数据框中的空行[重复]
【发布时间】:2019-03-25 21:12:40
【问题描述】:

当我将一个相当大的数据集(即维基百科的档案)加载到 spark 数据框中时,我收到以下错误:

    at java.util.concurrent.ThreadPoolExecutor.runWorker(ThreadPoolExecutor.java:1149)
    at java.util.concurrent.ThreadPoolExecutor$Worker.run(ThreadPoolExecutor.java:624)
    ... 1 more
Caused by: java.lang.NullPointerException
    at org.apache.spark.ml.feature.Tokenizer$$anonfun$createTransformFunc$1.apply(Tokenizer.scala:39)
    at org.apache.spark.ml.feature.Tokenizer$$anonfun$createTransformFunc$1.apply(Tokenizer.scala:39)

在 pyspark 数据框中删除 Null 值的最佳方法是什么?

【问题讨论】:

  • 这是从pyspark中的数据框中删除空行的函数df = df.dropna(how='all')

标签: dataframe null pyspark


【解决方案1】:

您可以使用na.drop() 来删除包括 Null 值在内的所有行:

df.na.drop()

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2023-04-07
    • 1970-01-01
    • 2021-01-01
    • 1970-01-01
    • 2019-09-09
    • 1970-01-01
    相关资源
    最近更新 更多