【问题标题】:how to select and count the each individual words from file?如何从文件中选择和计算每个单词?
【发布时间】:2021-03-18 02:10:53
【问题描述】:
hello how are you
I am fine
how are you
I am also fine
Thank you

这是我的文件,我想计算文件中每个单词重复了多少次?所以输出应该是这样的

(hello,1)
(how,2)
(are,2)
(you,3)

等等。

我试过了

val rdd = sc.textFile("/path")
val rdd1= rdd.map(x=>(x.distinct,x.length)).collect

但它没有工作?请帮忙。

【问题讨论】:

  • 你好,第一行,编辑时被删除了

标签: scala apache-spark count rdd distinct-values


【解决方案1】:

你可以使用countByValue():

rdd.map(x => x.split(" ")).flatMap(x => x).countByValue()

返回地图:

Map(are -> 2, am -> 2, I -> 2, you -> 3, also -> 1, how -> 2, Thank -> 1, fine -> 2, hello -> 1)

如果你想要一个 RDD,你可以这样做

val rdd1 = sc.parallelize(rdd.map(x => x.split(" ")).flatMap(x => x).countByValue().toSeq)

【讨论】:

  • 谢谢它的工作,我在最后添加了 .foreach(prinln)
猜你喜欢
  • 1970-01-01
  • 2013-02-15
  • 1970-01-01
  • 1970-01-01
  • 2021-10-07
  • 2016-10-28
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多