【发布时间】:2019-07-05 14:20:35
【问题描述】:
这可能是一个非常愚蠢的问题,但我无法通过 Google 找到答案。我编写了一个简单的 pyspark ETL 脚本,它读取 CSV 并将其写入 Parquet,如下所示:
spark = SparkSession.builder.getOrCreate()
sqlContext = SQLContext(spark.sparkContext)
df = sqlContext.read.csv(input_filename)
df.write.parquet(output_path)
为了运行它,我在 Docker 中启动了一个本地 Spark 集群:
$ docker run --network=host jupyter/pyspark-notebook
我运行 Python 脚本,它连接到这个本地 Spark 集群,一切都按预期工作。
现在我想在远程 Spark 集群 (AWS EMR) 上运行相同的脚本。我可以在初始化 Spark 上下文时在某处指定一个远程 IP 地址吗?还是我误解了 Spark 的工作原理?
【问题讨论】:
标签: apache-spark pyspark amazon-emr