【问题标题】:Spark SQL join on two RDDs created using java使用 java 创建的两个 RDD 上的 Spark SQL 连接
【发布时间】:2015-01-31 20:28:49
【问题描述】:

我创建了两个 RDD 并使用 java 将它们持久化。我已将 jar 提交给 spark master。现在当spark shell提示我输入查询时,我已经给出了两个RDD上的SQL语句join条件;然后它在对结果集执行 collect() 时抛出异常。

JOIN Condition : 从 TABLE_1 中选择 a.ID 作为 JOIN TABLE_2 b ON a.NAME = b.NAME;

异常:resultSet.collect() 上的空指针异常

PS:我在 resultSet.collect(); 之前检查了结果集是否为 null;但它仍然进入条件并抛出 NPE。我正在使用 spark-sql-1.1.1 jar(最新)。

SPARK SQL 中的 JOIN 是否存在问题?

【问题讨论】:

  • 你能粘贴你的代码和NPE的堆栈跟踪吗?
  • 不应该是 JOIN TABLE_2 as b 吗?
  • 看起来 Java spark API 在某些 JOIN 操作方面存在问题。当我尝试使用 scala 时它工作正常。无论如何感谢您的帮助。

标签: java join apache-spark apache-spark-sql


【解决方案1】:

看起来 Java spark API 的某些 JOIN 操作存在问题。当我尝试使用 scala 时它工作正常

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2015-11-16
    • 1970-01-01
    • 2018-03-29
    • 2016-12-23
    • 2015-09-24
    • 2020-10-29
    相关资源
    最近更新 更多