【发布时间】:2019-07-24 06:04:24
【问题描述】:
有人可以提供一个使用 pyspark 的示例,说明如何运行自定义 Apache Phoenix SQL 查询并将该查询的结果存储在 RDD 或 DF 中。注意:我正在寻找一个自定义查询,而不是要读入 RDD 的整个表。
从 Phoenix 文档中,我可以使用这个来加载整个表格:
table = sqlContext.read \
.format("org.apache.phoenix.spark") \
.option("table", "<TABLENAME>") \
.option("zkUrl", "<hostname>:<port>") \
.load()
我想知道使用自定义 SQL 的对应等价物是什么
sqlResult = sqlContext.read \
.format("org.apache.phoenix.spark") \
.option("sql", "select * from <TABLENAME> where <CONDITION>") \
.option("zkUrl", "<HOSTNAME>:<PORT>") \
.load()
谢谢。
【问题讨论】:
标签: apache-spark pyspark apache-spark-sql spark-dataframe phoenix