【发布时间】:2016-10-03 14:43:07
【问题描述】:
我有两个数据集,每个数据集都有两个元素。 以下是示例。
Data1:(名称,动物)
('abc,def', 'monkey(1)')
('df,gh', 'zebra')
...
Data2:(名称,水果)
('a,efg', 'apple')
('abc,def', 'banana(1)')
...
预期结果:(名称、动物、水果)
('abc,def', 'monkey(1)', 'banana(1)')
...
我想通过使用第一列“名称”来连接这两个数据集。我已经尝试这样做了几个小时,但我无法弄清楚。谁能帮帮我?
val sparkConf = new SparkConf().setAppName("abc").setMaster("local[2]")
val sc = new SparkContext(sparkConf)
val text1 = sc.textFile(args(0))
val text2 = sc.textFile(args(1))
val joined = text1.join(text2)
以上代码不工作!
【问题讨论】:
-
您在哪里将输入文本拆分为
(key, value)元组? -
你得到什么样的错误?它告诉你什么?
-
@maasg 它说''无法解析符号连接。'
-
但是,它不是已经有 (key, value) 的格式了吗?我真的很困惑..
-
这也可以为数据集更新吗?解决方案仅包含 RDD
标签: scala apache-spark