【发布时间】:2017-07-16 00:37:52
【问题描述】:
我有一列填充了一堆州的首字母作为字符串。我的目标是如何计算此类列表中每个州的数量。
例如:(("TX":3),("NJ":2)) 应该是"TX" 和"NJ" 出现两次时的输出。
我对 pyspark 还很陌生,所以我被这个问题难住了。任何帮助将不胜感激。
【问题讨论】:
-
我对 pyspark 一无所知,但如果你的字符串集合是可迭代的,你可以将它传递给
collections.Counter,它的存在是为了明确计算不同的值。