【发布时间】:2015-01-31 20:28:49
【问题描述】:
我创建了两个 RDD 并使用 java 将它们持久化。我已将 jar 提交给 spark master。现在当spark shell提示我输入查询时,我已经给出了两个RDD上的SQL语句join条件;然后它在对结果集执行 collect() 时抛出异常。
JOIN Condition : 从 TABLE_1 中选择 a.ID 作为 JOIN TABLE_2 b ON a.NAME = b.NAME;
异常:resultSet.collect() 上的空指针异常
PS:我在 resultSet.collect(); 之前检查了结果集是否为 null;但它仍然进入条件并抛出 NPE。我正在使用 spark-sql-1.1.1 jar(最新)。
SPARK SQL 中的 JOIN 是否存在问题?
【问题讨论】:
-
你能粘贴你的代码和NPE的堆栈跟踪吗?
-
不应该是 JOIN TABLE_2 as b 吗?
-
看起来 Java spark API 在某些 JOIN 操作方面存在问题。当我尝试使用 scala 时它工作正常。无论如何感谢您的帮助。
标签: java join apache-spark apache-spark-sql