【发布时间】:2017-05-31 06:59:37
【问题描述】:
我是 spark scala 的新手,想找到每个部门的最高薪水
Dept,Salary
Dept1,1000
Dept2,2000
Dept1,2500
Dept2,1500
Dept1,1700
Dept2,2800
我实现了下面的代码
import org.apache.spark.SparkContext
import org.apache.spark.SparkContext._
import org.apache.spark.SparkConf
object MaxSalary {
val sc = new SparkContext(new SparkConf().setAppName("Max Salary").setMaster("local[2]"))
case class Dept(dept_name : String, Salary : Int)
val data = sc.textFile("file:///home/user/Documents/dept.txt").map(_.split(","))
val recs = data.map(r => (r(0), Dept(r(0), r(1).toInt)))
val a = recs.max()???????
})
}
但卡住了如何实现 group by 和 max 功能。我正在使用对 RDD。
谢谢
【问题讨论】:
标签: scala apache-spark