【发布时间】:2021-08-16 12:07:42
【问题描述】:
我有一个 (key, value) 对的 rdd,键是字符串,值是字符串的出现次数。
words.take(10)
Out[98]: [('The', 2767),
('Project', 83),
('the', 3),
('of', 14941),
('Leo', 4),
('is', 3245),
('use', 80),
('anyone', 191),
('Of', 25),
('at', 4235)]
我想通过 key.lower() 匹配键,对它们的值求和,并为每个大写/小写键保留原始值。
另外,我想过滤掉不重复的键。
所以我上面的 words.take(10) 示例的输出将是:
[(('The', 2767),('the', 3),2770),(('Of', 25),('of', 14941),14966)]
【问题讨论】:
标签: python apache-spark rdd