【发布时间】:2017-02-16 23:51:44
【问题描述】:
我正在尝试将 csv 文件读入数据框。我知道我的数据框的架构应该是什么,因为我知道我的 csv 文件。另外我正在使用 spark csv 包来读取文件。我试图指定如下架构。
val pagecount = sqlContext.read.format("csv")
.option("delimiter"," ").option("quote","")
.option("schema","project: string ,article: string ,requests: integer ,bytes_served: long")
.load("dbfs:/databricks-datasets/wikipedia-datasets/data-001/pagecounts/sample/pagecounts-20151124-170000")
但是当我检查我创建的数据框的架构时,它似乎采用了自己的架构。我做错什么了吗?如何让 spark 获取我提到的架构?
> pagecount.printSchema
root
|-- _c0: string (nullable = true)
|-- _c1: string (nullable = true)
|-- _c2: string (nullable = true)
|-- _c3: string (nullable = true)
【问题讨论】:
-
您使用的是哪个版本的 spark ?
标签: scala apache-spark dataframe apache-spark-sql spark-csv