【发布时间】:2017-02-23 16:03:35
【问题描述】:
我正在尝试过滤具有 NA 值的数据集..找到 org.apache.spark.sql.DataFrameNaFunctions 但似乎它的 drop() 或 drop("any") 似乎无法正常工作..任何人都尝试过..或者请分享 java 中的用法..谢谢...
import org.apache.spark.sql.DataFrameNaFunctions;
Dataset<Row> inputDS=spark.read().option("header","true").
csv("inputfile.csv");
inputDS.show();
//Updated dataset...remove null or NAN
DataFrameNaFunctions inputDatasetsansNullorNAN=new DataFrameNaFunctions(inputDS);
Dataset<Row> inputDSnulldropped=inputDatasetsansNullorNAN.drop();
inputDSnulldropped.show();
............ 输入文件
name item
1.爱丽丝,牛奶
2.鲍勃,空
3. 不适用,
4.测试,一个
5. 不适用,不适用
6.空,不适用
7.鲍勃,北美
8.
9.
输出
名称项目 1.爱丽丝牛奶 2.鲍勃空 3.测试一个 4.NA NA 5.null 不适用 6.鲍勃 NA
【问题讨论】:
标签: apache-spark apache-spark-sql