【发布时间】:2019-09-17 19:07:02
【问题描述】:
在远程 SFTP 服务器中,我有带有一些数据的 csv 文件。是否可以将 DataFrame 的数据添加到这个现有文件中?换句话说,csv文件中以前的数据不应该被覆盖。
我使用spark-sftp 库来完成这项任务,并注意到下面的代码重新创建了文件。换句话说,csv文件中以前的数据消失了。您有什么建议可以改善这种情况?
val df: DataFrame = Seq(
("Alex", "2018-01-01 00:00:00", "2018-02-01 00:00:00", "OUT"),
("Bob", "2018-02-01 00:00:00", "2018-02-05 00:00:00", "IN"),
("Kate", "2018-02-01 00:00:00", "2018-02-05 00:00:00", "IN"),
("Alice", "2018-02-01 00:00:00", "2018-02-05 00:00:00", "OUT"),
).toDF("FIRST_NAME", "START_DATE", "END_DATE", "STATUS")
df.write.
format("com.springml.spark.sftp").
option("host", "XXXX").
option("username", "XXXX").
option("password", "****").
option("fileType", "csv").
option("delimiter", ";").
save("/PATH/test.csv")
【问题讨论】:
标签: scala csv apache-spark apache-spark-sql sftp