【问题标题】:How do I write query from Spark to Redshift?如何将查询从 Spark 写入 Redshift?
【发布时间】:2019-10-02 23:26:41
【问题描述】:

我通过 SSH 连接到 Glue 中的 Dev Endpoint。 Spark 2.4.1 正在运行。

我想运行一个简单的查询select * from pg_namespace;

然后,想使用 COPY 命令将数据从 S3 移动到 Redshift。

如何在 Spark 控制台中编写它?

谢谢。

【问题讨论】:

    标签: apache-spark amazon-redshift aws-glue


    【解决方案1】:

    不确定是否可以直接使用 COPY 命令,我还没有尝试过。

    要将数据从 S3 移动到 Redshift,您可以使用 AWS Glue API。 Please check here for sample codes from AWS?在幕后,我认为 AWS Glue 使用 COPY / UNLOAD 命令在 S3 和 REDSHIFT 之间移动数据。

    【讨论】:

      【解决方案2】:

      您可以从 ssh 终端使用 aws clipsql

      对于 psql 检查https://docs.aws.amazon.com/redshift/latest/mgmt/connecting-from-psql.html

      然后你可以从中运行selectcopy 命令。

      但我不推荐,因为 AWS Glue 是无服务器服务,因此您的集群每次都会有所不同。

      【讨论】:

      • 我没有投反对票。但也想知道 - 因为我的要求是运行 Glue 作业 - 需要设置什么才能从 Glue 连接到 RedShift(URL、用户/密码除外)?
      • 哦。如果是胶水作业,请检查docs.aws.amazon.com/glue/latest/dg/…
      猜你喜欢
      • 2017-06-05
      • 2017-04-17
      • 2018-09-20
      • 2016-11-20
      • 1970-01-01
      • 2016-06-14
      • 2017-04-07
      • 2018-08-15
      • 2019-09-06
      相关资源
      最近更新 更多