【发布时间】:2019-11-08 15:41:48
【问题描述】:
具体来说,如何添加 spark-bigquery-connector 以便我可以从 dataproc 的 Jupyter Web 界面中查询数据?
关键链接: - https://github.com/GoogleCloudPlatform/spark-bigquery-connector
目标: 为了能够运行类似的东西:
s = spark.read.bigquery("transactions")
s = (s
.where("quantity" >= 0)
.groupBy(f.col('date'))
.agg({'sales_amt':'sum'})
)
df = s.toPandas()
【问题讨论】:
-
我认为您可以编写一个初始化操作来将 jar 下载到 /usr/lib/spark/jars 中。
标签: maven google-cloud-platform pyspark google-cloud-dataproc