【问题标题】:How to combine two RDDs in Spark (Scala)? [duplicate]如何在 Spark(Scala)中组合两个 RDD? [复制]
【发布时间】:2017-03-31 23:34:28
【问题描述】:

所以,假设我有以下两个 RDDS: (这些只是每个 RDD 的前几行)

RDD1:

Time                   Temp 
2014-08-12 13:20:00    22
2014-08-12 13:21:00    24
2014-08-12 13:24:00    26
2014-08-12 13:26:00    27
2014-08-12 13:28:00    22

RDD2:

Time                   Age 
2014-08-12 13:20:00    45
2014-08-12 13:21:00    45
2014-08-12 13:24:00    46
2014-08-12 13:26:00    37
2014-08-12 13:28:00    122

我想将它们组合起来,以便将 RDD2 的列添加到 RDD1。我不能使用联合,因为这只会将 RDD2 添加到 RDD1 的底部,而我想将它添加到“边”,如果这有意义的话。

【问题讨论】:

  • 你需要加入他们

标签: scala apache-spark


【解决方案1】:

join 会让你“并排”加入这些RDDs。来自文档:

"当在 (K, V) 和 (K, W) 类型的数据集上调用时,返回 (K, (V, W)) 对的数据集,其中每个键的所有元素对。外连接通过 leftOuterJoin、rightOuterJoin 和 fullOuterJoin 支持。"

【讨论】:

    猜你喜欢
    • 2015-10-18
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-12-31
    • 1970-01-01
    • 2023-04-07
    • 2016-09-07
    相关资源
    最近更新 更多