【发布时间】:2017-05-06 18:42:31
【问题描述】:
我在 pyspark 中有以下 RDD,我相信这应该很简单,但一直无法弄清楚:
information = [ (10, 'sentence number one'),
(17, 'longer sentence number two') ]
rdd = sc.parallelize(information)
我需要应用一个转换,将 RDD 变成这样:
[ ('sentence', 10),
('number', 10),
('one', 10),
('longer', 17),
('sentence', 17),
('number', 17),
('two', 17) ]
基本上把一个句子的key扩展成多行,以单词为key。
我想避免使用 SQL。
【问题讨论】:
标签: python apache-spark pyspark rdd