【发布时间】:2019-03-25 21:12:40
【问题描述】:
当我将一个相当大的数据集(即维基百科的档案)加载到 spark 数据框中时,我收到以下错误:
at java.util.concurrent.ThreadPoolExecutor.runWorker(ThreadPoolExecutor.java:1149)
at java.util.concurrent.ThreadPoolExecutor$Worker.run(ThreadPoolExecutor.java:624)
... 1 more
Caused by: java.lang.NullPointerException
at org.apache.spark.ml.feature.Tokenizer$$anonfun$createTransformFunc$1.apply(Tokenizer.scala:39)
at org.apache.spark.ml.feature.Tokenizer$$anonfun$createTransformFunc$1.apply(Tokenizer.scala:39)
在 pyspark 数据框中删除 Null 值的最佳方法是什么?
【问题讨论】:
-
这是从pyspark中的数据框中删除空行的函数df = df.dropna(how='all')