【发布时间】:2017-11-30 15:25:30
【问题描述】:
我有两个字符串的 rdd JoindStrings: RDD[(String, String)] 我需要计算每对字符串之间的相似度 我试过这个:
val similarPairsRdd: RDD[(String, String, Double)] =
JoindStrings.map(x => (x._1, x._2, getSimilarity(x._1, x._2)))
函数getSimilarity 接受两个字符串并返回双精度
我在线程“main”中有一个异常
org.apache.spark.SparkException:任务不可序列化
另外,我尝试了JoindStrings.map.collect()(x => ...,但它给了我数组而不是 rdd
这个异常有解决办法吗?
【问题讨论】:
标签: scala apache-spark