【发布时间】:2019-06-12 17:07:52
【问题描述】:
我正在使用 Spark 并使用 Scala
我有两个 csv 文件,一个有列名,另一个有数据,我如何整合它们,以便我可以使用架构和数据制作结果文件,然后我必须对该文件应用操作,例如groupby、cout 等,因为我需要计算这些列中的不同值。
所以任何人都可以在这里提供帮助将非常有帮助
我写了下面的代码,在读取它们之后从两个文件中创建了两个 DF,而不是我现在使用 union 加入了两个 DF,我如何将第一行作为模式,或者以任何其他方式进行此操作。任何人都可以提出建议。
val sparkConf = new SparkConf().setMaster("local[4]").setAppName("hbase sql")
val sc = new SparkContext(sparkConf)
val spark1 = SparkSession.builder().config(sc.getConf).getOrCreate()
val sqlContext = spark1.sqlContext
val spark = SparkSession
.builder
.appName("SparkSQL")
.master("local[*]")
.getOrCreate()
import spark.implicits._
val lines = spark1.sparkContext.textFile("C:/Users/ayushgup/Downloads/home_data_usage_2018122723_1372672.csv").map(lines=>lines.split("""\|""")).toDF()
val header = spark1.sparkContext.textFile("C:/Users/ayushgup/Downloads/Header.csv").map(lin=>lin.split("""\|""")).toDF()
val 文件 = header.unionAll(lines).toDF()
【问题讨论】:
标签: sql scala apache-spark hadoop