【发布时间】:2019-04-08 06:33:26
【问题描述】:
我有一个 xml 文件,我必须通过该文件将数据读入 pyspark。我正在使用 spark-xml api 读取它,但它不起作用。 The link is here for git repository.
我使用了python api,但它没有显示结果并引发异常。
java.lang.ClassNotFoundException: Failed to find data source: com.databricks.spark.xml. Please find packages at http://spark.apache.org/third-party-projects.html
df = spark.read \
.format('com.databricks.spark.xml') \
.options(rowTag='Receipt') \
.load('***.XML', schema = customSchema)
当我转到它建议的链接时,它没有显示任何 xml。
最后,我想读取 xml 文件,然后将其存储到 pyspark 数据帧中。
【问题讨论】:
-
试试:
df = spark.read.format('xml').options(rowTag='Receipt').load('***.XML', schema = customSchema) -
是的,我之前也试过了,但是不行。
标签: python xml python-3.x pyspark apache-spark-sql