【发布时间】:2016-09-30 12:46:23
【问题描述】:
我遇到了一个问题,正在寻求您的帮助。我的任务是将JSON 文件转换为dataSet,以便可以将其加载到HIVE。
代码 1
SparkSession spark1 = SparkSession
.builder()
.appName("File_Validation")
.config("spark.some.config.option", "some-value")
.getOrCreate();
Dataset<Row> df = spark1.read().json("input/sample.json");
df.show();
上面的代码给我一个 NullPointerException。 我尝试了另一种方法
代码 2
JavaRDD<String> jsonFile = context.textFile("input/sample.json");
Dataset<Row> df2 = spark1.read().json(jsonFile);
df2.show();
创建一个 RDD 并将其传递给 spark1 (sparkSession)
此代码 2 将 json 制作成另一种格式,标题为
+--------------------+
| _corrupt_record|
+--------------------+
with schema as - |-- _corrupt_record: string (nullable = true)
请帮忙修复它。
示例 JSON
{
"user": "gT35Hhhre9m",
"dates": ["2016-01-29", "2016-01-28"],
"status": "OK",
"reason": "some reason",
"content": [{
"foo": 123,
"bar": "val1"
}, {
"foo": 456,
"bar": "val2"
}, {
"foo": 789,
"bar": "val3"
}, {
"foo": 124,
"bar": "val4"
}, {
"foo": 126,
"bar": "val5"
}]
}
【问题讨论】:
标签: apache-spark apache-spark-sql bigdata