【发布时间】:2018-03-26 06:36:30
【问题描述】:
我是 Scala 和 Spark 的新手。我正在尝试删除文本文件的重复行。 每行包含三列(向量值),例如:-4.5,-4.2,2.7
这是我的程序:
import org.apache.spark.SparkContext
import org.apache.spark.SparkConf
import org.apache.spark.rdd.RDD
import scala.collection.mutable.Map
object WordCount {
def main(args: Array[String]) {
val conf = new SparkConf().setAppName("WordCount").setMaster("local[*]")
val sc = new SparkContext(conf)
val input = sc.textFile("/opt/spark/WC/WC_input.txt")
val keys = input.flatMap(line => line.split("/n"))
val singleKeys = keys.distinct
singleKeys.foreach(println)
}
}
它有效,但我想知道是否有一种方法可以使用过滤器功能。我必须在我的程序中使用它,但我不知道如何在所有行之间进行迭代并删除重复项(例如使用循环)。
如果有人有想法,那就太好了!
谢谢!
【问题讨论】:
标签: scala apache-spark filter rdd