【发布时间】:2016-07-04 23:59:38
【问题描述】:
我在 Amazon EMR 上运行 Spark,其公共 DNS 为 23.21.40.15。
现在我正在这个集群上执行我的 Spark Jar,我想将我的 Spark 作业的输出写入公共 DNS 为 29.45.56.72 的其他 Amazon EMR HDFS。
我能够访问我自己的集群 HDFS,即 23.21.40.15,但我无法写入集群 29.45.56.72。
- 我需要做什么才能让我的 spark 作业可以访问跨集群 HDFS??
- 如果可能,任何人都可以为此分享示例代码吗??
【问题讨论】:
-
你能在第一个集群上写出来,然后使用 distCp 将输出移动到第二个集群吗?
-
这是我想的一种间接方式....但是如果我的目的地是第二个集群怎么办?我的意思是如果我想从第一个集群将它写入第二个集群的 hdfs ??
标签: hadoop apache-spark amazon-emr databricks