【发布时间】:2017-02-14 17:42:47
【问题描述】:
我将一些 CSV 文件读入 pandas,对其进行了很好的预处理并将 dtypes 设置为所需的 float、int、category 值。但是,当尝试将其导入 spark 时,出现以下错误:
Can not merge type <class 'pyspark.sql.types.DoubleType'> and <class 'pyspark.sql.types.StringType'>
在尝试追踪一段时间后,我找到了一些问题的来源 -> 查看 CSV 文件:
"myColumns"
""
"A"
red into pandas 喜欢:small = pd.read_csv(os.path.expanduser('myCsv.csv'))
并且未能将其导入以激发:
sparkDF = spark.createDataFrame(small)
目前我使用 Spark 2.0.0
可能有多个列受到影响。我该如何处理这个问题?
【问题讨论】:
-
我确认这个问题在 2.0.1 中仍然存在
标签: python csv pandas apache-spark pyspark