【发布时间】:2019-02-12 00:46:59
【问题描述】:
我正在寻找一个批处理加载器,用于使用带有 DataFormatWriter 的 PySpark 脚本将粘合作业加载到 RDS 中。 我有这个为 RedShift 工作,如下所示:
df.write \
.format("com.databricks.spark.redshift") \
.option("url", jdbcconf.get("url") + '/' + DATABASE + '?user=' + jdbcconf.get('user') + '&password=' + jdbcconf.get('password')) \
.option("dbtable", TABLE_NAME) \
.option("tempdir", args["TempDir"]) \
.option("forward_spark_s3_credentials", "true") \
.mode("overwrite") \
.save()
上面定义了df 以读取文件。在 RDS 中而不是在 REDSHIFT 中,我可以采取的最佳方法是什么?
【问题讨论】:
标签: amazon-web-services amazon-rds aws-glue