【发布时间】:2015-12-10 09:46:19
【问题描述】:
根据上述主题,我对 python spark 非常陌生,我想将一个 Rdd 的字段映射到另一个 Rdd 的字段。示例如下
rdd1:
c_id name
121210 abc
121211 pqr
rdd2:
c_id cn_id cn_value
121211 0 0
121210 0 1
所以匹配的 c_id 将被 name 替换为 cnid 和聚合的 cn_value。所以输出会像这样 abc 0 0 pqr 0 1
from pyspark import SparkContext
import csv
sc = SparkContext("local", "spark-App")
file1 = sc.textFile('/home/hduser/sample.csv').map(lambda line:line.split(',')).filter(lambda line:len(line)>1)
file2 = sc.textFile('hdfs://localhost:9000/sample2/part-00000').map(lambda line:line.split(','))
file1_fields = file1.map(lambda x: (x[0],x[1]))
file2_fields = file2.map(lambda x: (x[0],x[1],float(x[2])))
我怎样才能通过在这里放一些代码来实现我的目标。
任何帮助将不胜感激 谢谢你
【问题讨论】:
标签: python apache-spark pyspark