【发布时间】:2019-10-02 23:26:41
【问题描述】:
我通过 SSH 连接到 Glue 中的 Dev Endpoint。 Spark 2.4.1 正在运行。
我想运行一个简单的查询select * from pg_namespace;
然后,想使用 COPY 命令将数据从 S3 移动到 Redshift。
如何在 Spark 控制台中编写它?
谢谢。
【问题讨论】:
标签: apache-spark amazon-redshift aws-glue
我通过 SSH 连接到 Glue 中的 Dev Endpoint。 Spark 2.4.1 正在运行。
我想运行一个简单的查询select * from pg_namespace;
然后,想使用 COPY 命令将数据从 S3 移动到 Redshift。
如何在 Spark 控制台中编写它?
谢谢。
【问题讨论】:
标签: apache-spark amazon-redshift aws-glue
不确定是否可以直接使用 COPY 命令,我还没有尝试过。
要将数据从 S3 移动到 Redshift,您可以使用 AWS Glue API。 Please check here for sample codes from AWS?在幕后,我认为 AWS Glue 使用 COPY / UNLOAD 命令在 S3 和 REDSHIFT 之间移动数据。
【讨论】:
您可以从 ssh 终端使用 aws cli 和 psql。
对于 psql 检查https://docs.aws.amazon.com/redshift/latest/mgmt/connecting-from-psql.html
然后你可以从中运行select 和copy 命令。
但我不推荐,因为 AWS Glue 是无服务器服务,因此您的集群每次都会有所不同。
【讨论】: