【发布时间】:2014-08-22 04:49:12
【问题描述】:
我正在尝试使用 pyspark 解决以下问题。 我在 hdfs 上有一个文件,格式是查找表的转储。
key1, value1
key2, value2
...
我想将它加载到 pyspark 中的 python 字典中,并将其用于其他目的。所以我尝试这样做:
table = {}
def populateDict(line):
(k,v) = line.split(",", 1)
table[k] = v
kvfile = sc.textFile("pathtofile")
kvfile.foreach(populateDict)
我发现表变量没有被修改。那么,有没有办法在 spark 中创建一个大的内存哈希表?
【问题讨论】:
标签: python apache-spark