【发布时间】:2015-07-15 16:52:44
【问题描述】:
我对 Python 中的 Apache Spark 比较陌生,这就是我想要做的。我输入的数据如下。
-
rdd_row是行索引 (i) 的 RDD, -
rdd_col是列索引 (j) 的 RDD, -
rdd_values是值 (v) 的 RDD。
以上三个RDD都很大。
我正在尝试将它们转换为稀疏 rdd 矩阵
rdd_mat= ([rdd_row],[rdd_col],[rdd_values])
即,
rdd_mat=([i1,i2,i3 ..],[j1,j2,j3..], [v1,v2,v3 ..])
我试过了:
zip where rdd_row.zip(rdd_col).zip(rdd_val)
但它最终给了
[(i1,j1,v1),(i2,j2,v2) ..]
和
rdd1.union(rdd2)
不会创建元组。
非常感谢帮助我朝着正确的方向前进!
【问题讨论】:
-
您尝试做的可能不是捕捉 RDD 的好处。为什么你想要一个包含 3 个并行列表的 RDD?
-
谢谢院长。我的输入分为 3 个列表 - 行、列和值。我的印象是,一个包含 3 个列表的 RDD 将使我能够以更简单的方式执行矩阵运算。
标签: python apache-spark tuples rdd pyspark