【发布时间】:2015-10-21 13:30:40
【问题描述】:
当 CSV 在 spark 中被读取为数据帧时,所有列都被读取为字符串。有什么方法可以获取列的实际类型吗?
我有以下 csv 文件
Name,Department,years_of_experience,DOB
Sam,Software,5,1990-10-10
Alex,Data Analytics,3,1992-10-10
我已使用以下代码阅读了 CSV
val df = sqlContext.
read.
format("com.databricks.spark.csv").
option("header", "true").
option("inferSchema", "true").
load(sampleAdDataS3Location)
df.schema
所有列都被读取为字符串。我希望列 years_of_experience 被阅读为 int 和 DOB 被阅读为 date
请注意,我已将选项 inferSchema 设置为 true。
我正在使用最新版本(1.0.3)的 spark-csv 包
我错过了什么吗?
【问题讨论】:
标签: scala apache-spark apache-spark-sql spark-csv