【发布时间】:2018-04-17 15:52:56
【问题描述】:
我正在使用 Apache Spark 和 Scala。
我有一个第一行没有列名的 csv 文件。是这样的:
28,Martok,49,476
29,Nog,48,364
30,Keiko,50,175
31,Miles,39,161
这些列代表 ID、姓名、年龄、numOfFriends。
在我的 Scala 对象中,我使用来自 csv 文件的 SparkSession 创建数据集,如下所示:
val spark = SparkSession.builder.master("local[*]").getOrCreate()
val df = spark.read.option("inferSchema","true").csv("../myfile.csv")
df.printSchema()
当我运行程序时,结果是:
|-- _c0: integer (nullable = true)
|-- _c1: string (nullable = true)
|-- _c2: integer (nullable = true)
|-- _c3: integer (nullable = true)
如何向数据集中的列添加名称?
【问题讨论】:
标签: scala csv apache-spark apache-spark-sql