【发布时间】:2020-04-24 19:05:40
【问题描述】:
我有 RDD[Map[String, String]] ,需要转换为 datframe 以便我可以将数据保存在 parquet 文件中,其中映射键是列名。
例如:
val inputRdf = spark.sparkContext.parallelize(List(Map("city" -> "", "ip" -> "42.106.1.102", "source" -> "PlayStore","createdDate"->"2020-04-21"),
Map("city" -> "delhi", "ip" -> "42.1.15.102", "source" -> "PlayStore","createdDate"->"2020-04-21"),
Map("city" -> "", "ip" -> "42.06.15.102", "source" -> "PlayStore","createdDate"->"2020-04-22")))
输出:
City | ip
Delhi| 1.234
【问题讨论】:
标签: scala apache-spark apache-spark-sql parquet