【发布时间】:2016-12-26 23:11:12
【问题描述】:
我是 pyspark 的新手,我想写一个类似的查询,
select * from table1 where column like '%word1%' 我们用 sql 或 hive 写的。
我正在编写以下命令,
data = sqlCtx.sql('select * from table1 where column like '%word1%')
但是我遇到了一些错误,例如,
NameError: name 'word1' is not defined
我最理想的情况是,
select word_name from table2;
将给出一个单词列表,每当这些单词出现在 table1 的任何列中时,我想过滤掉这些条目并给出剩余的行并将其放入数据框中。
谁能帮我做这件事?
谢谢
【问题讨论】:
-
不应该是:
"select * from table1 where column like '%word1%'")? -
@Dair 哦,是的.. 我的错!但是你能帮我解决第二个要求,我们可以从 table2 中获取单词并将其过滤掉吗?
-
不好意思,对spark中的SQL模块不太了解。看起来这可能是一个快速修复。
标签: python sql apache-spark dataframe pyspark