【发布时间】:2019-04-10 10:37:47
【问题描述】:
我有一个简单的 python 代码,其中包括使用具有我的凭据的 JSON 文件连接 bigQuery。
data = pd.read_gbq(SampleQuery, project_id='XXXXXXXX', private_key='filename.json')
这里的 filename.json 格式如下:
{
"type": "service_account",
"project_id": "projectId",
"private_key_id": "privateKeyId",
"private_key": "privateKey",
"client_email": "clientEmail",
"client_id": "clientId",
"auth_uri": "https://accounts.google.com/o/oauth2/auth",
"token_uri": "https://oauth2.googleapis.com/token",
"auth_provider_x509_cert_url": "https://www.googleapis.com/oauth2/v1/certs",
"client_x509_cert_url": "https://www.googleapis.com/robot/v1/metadata/x509/clientEmail"
}
现在,我需要将此代码移植到 pyspark。但是我很难找到如何使用 Spark SQL 进行查询。我正在使用 AWS EMR 集群来运行这个查询!
任何帮助将不胜感激!
【问题讨论】:
-
如果你能给出你尝试连接的示例代码,但它不起作用,那就太好了。
-
BigQuery Storage API 就是为此目的而设计的,并且有一个专门构建的Spark SQL connector。
-
嗨,Kenneth,这看起来很有趣,您能否提供更多代码示例来说明它是如何工作的以及它是如何解决问题的
-
README.md 中有一些关于如何将连接器与现有 Spark 集群一起使用的文档,包括 scala 和 pyspark 示例。你能具体告诉我你在寻找什么吗?我帮不了你,但我可能会找到能帮到你的人。
标签: apache-spark pyspark google-bigquery pyspark-sql amazon-emr