【发布时间】:2018-05-11 23:42:52
【问题描述】:
我在 Spark 2.3.0 中使用结构化流将数据集写入 S3。我的流式查询如下所示:
StreamingQuery query = ds.writeStream().format("parquet").outputMode(OutputMode.Append())
.option("checkpointLocation", "s3://my-checkpoint-location/" )
.option("path", "s3://my-output-data-location")
.partitionBy("my-partition-column-name")
.start();
上面的代码完美运行。我的数据集的列名是:firstName 和 lastName。我希望我的输出数据/镶木地板文件具有列名first_name 和last_name。有没有一种简单的方法可以通过添加另一个选项来做到这一点?如果不是,如果在我运行此代码 sn-p 时不知道列名,那么最简单的方法是什么?
【问题讨论】:
标签: java apache-spark apache-spark-sql spark-structured-streaming